Analizador OCR de documentos — captura de boletas de báscula
Un sistema con visión-LLM que lee ~50 boletas de báscula al día enviadas por WhatsApp y sustituye la captura manual por extracción validada y exportación en un clic.
- Rol
- Ingeniero full-stack de IA
- Cronograma
- Sistema en producción, uso diario
- Stack
- React / Vite · FastAPI · EasyOCR · Kimi K3 (visión) · Tesseract OSD · Supabase · Docker · PWA

Un sistema en operación diaria para la captura de boletas de basura — esta página incluye la demo en vivo.
Qué estaba roto
Un operador de manejo de residuos recibe ~50 fotos de boletas de báscula por WhatsApp cada día. Los operadores re-capturaban folio, cliente, peso y costo de cada foto en hojas de cálculo — lento, propenso a errores e imposible de auditar a ese volumen.
Cómo se resolvió
Construí un pipeline de preprocesamiento que normaliza la orientación EXIF, detecta la rotación del documento con Tesseract OSD y recorta cada foto a la región de la boleta antes del OCR. La extracción corre en un LLM de visión (Kimi K3) con procesamiento en paralelo y aislamiento de fallos por archivo; los resultados se guardan en Supabase y se validan cruzadamente (peso, costos esperados, folios duplicados) antes de que el operador apruebe o edite en línea.
Restricciones
- Las fotos llegan rotadas, inclinadas y mezcladas con la interfaz de WhatsApp — la entrada es desordenada por defecto.
- Los campos de peso deben validarse cruzadamente (Neto vs Toneladas x 1000) o un decimal perdido infla silenciosamente la factura.
- Los operadores no son usuarios avanzados: subir un lote, obtener una tabla validada, exportar a Excel.
Herramientas del sistema
- React / Vite
- FastAPI
- EasyOCR
- Kimi K3 (visión)
- Tesseract OSD
- Supabase
- Docker
- PWA
Qué cambió
El flujo diario que tomaba horas de re-captura ahora es subir → validar → exportar. Lotes de 50 escaneos se procesan en minutos con extracción de menos de un minuto por archivo, y la validación cruzada detecta los errores de decimales y unidades que solían colarse en las facturas.
Lo que se queda
- 01Un decimal perdido en '2.240' vs '2240' cambia la factura 1000x — las guardas de validación importan tanto como el modelo.
- 02Rotar y recortar antes del OCR importa más que la elección del modelo; el pipeline hizo confiable la lectura.
- 03Los operadores confían en la herramienta cuando cada valor puede editarse en línea y cada exportación es auditable.
Estudios de caso relacionados
Todo el trabajo- IA y Agentes · 2026Plataforma de inferencia GPU autoalojada — MoE de 36B, voz IA y un farm de 70 GPUsUn stack de IA completamente autoalojado: un modelo MoE de 36B servido de forma concurrente con embeddings, ASR y TTS en una sola GPU de 24 GB — escalado después a un farm de 70 GPUs en 10 nodos que un estado de reloj VBIOS defectuoso casi tumba.
- IA y Agentes · 2025Agente de soporte con retrieval-augmentedUn agente LLM que redacta respuestas a partir de los documentos internos de la empresa y entrega a un humano cuando no está seguro.