OCR tradicional vs. IA multimodelo: por qué las plantillas ya no alcanzan

La evolución honesta de la lectura de documentos: OCR por zonas, plantillas, machine learning, LLMs multimodales y agentes. Qué resuelve cada generación y qué no.

“OCR” se usa hoy para nombrar tecnologías que se llevan veinte años de diferencia. El resultado: empresas comparando un lector de caracteres de 2005 con un sistema de agentes de 2026 como si fueran el mismo producto con distinto precio. Esta nota ordena la evolución — qué resuelve cada generación, qué no, y sin humo: las generaciones nuevas también tienen límites.

Generación 1 — OCR clásico: leer caracteres

El OCR original hace una sola cosa: convertir píxeles en texto. Le das una imagen, te devuelve los caracteres que ve. Es una tecnología madura y excelente en lo suyo — el problema es que leer no es entender. De una factura devuelve un chorro de texto: “FACTURA A 0003-00012845 CUIT 30-58515628-7 TOTAL $281.930,00…” — todo junto, sin saber qué es cada cosa. Alguien (o algo) tiene que estructurarlo después.

Sigue siendo útil para: digitalizar texto corrido (libros, contratos escaneados) donde el objetivo es buscar o leer, no cargar campos.

Generación 2 — Plantillas y zonas: leer donde le digas

La primera respuesta al problema de estructura: decirle al OCR dónde mirar. “El CUIT está en este rectángulo, el total en este otro.” Por proveedor, por tipo de documento, se dibujan las zonas y el sistema extrae campos de verdad.

Funciona — mientras el mundo no cambie. Cada proveedor nuevo necesita su plantilla; cada rediseño de factura la rompe, y la rompe en silencio: el sistema sigue extrayendo del rectángulo, que ahora contiene otra cosa. Con 5 proveedores estables es viable; con los cientos de emisores heterogéneos que recibe una pyme argentina (las facturas C solas son un festival de formatos), el mantenimiento de plantillas se convierte en un puesto de trabajo.

El límite conceptual: el sistema no entiende el documento; entiende coordenadas.

Generación 3 — Machine learning: aprender patrones

Los servicios cloud de la década pasada (el tipo de tecnología detrás de AWS Textract o Google Document AI en sus versiones base) entrenaron modelos sobre millones de documentos para reconocer patrones generales: “esto tiene pinta de fecha”, “esto parece un total”, “esto es una tabla de ítems”. Adiós plantillas: el modelo generaliza a diseños que nunca vio.

Un salto enorme — con dos límites. Primero, la generalización es genérica: entrenados mayormente con documentos de EE.UU. y Europa, saben qué es un “invoice number” y un “VAT”, pero una percepción de IIBB, un CAE o la condición frente al IVA no son parte de su mundo. Segundo, devuelven resultados con la misma cara de seguridad tengan razón o no: la confianza que reportan es estadística del modelo, no una validación del dato.

El límite conceptual: entienden documentos en general, no TU tipo de documento en particular — ni te dicen con criterio cuándo dudar.

Generación 4 — LLMs multimodales: entender el documento

Los modelos de lenguaje con visión cambiaron la naturaleza del problema: ya no extraen por posición ni por patrón, sino que leen el documento como lo leería una persona — con contexto. Saben que si el comprobante dice “A” en el recuadro, el IVA debería venir discriminado; que un importe al pie con la palabra “TOTAL” cerca pesa más que otro número suelto; que “10/09/2026” después de “Vencimiento:” es una fecha de pago.

El costo de esa flexibilidad es conocido: los LLMs pueden alucinar — completar con plausibilidad lo que no pueden leer. En un poema es una anécdota; en un CUIT es un pasivo fiscal. Un LLM solo, sin controles, es demasiado creativo para datos contables.

El límite conceptual: máxima comprensión, mínimas garantías — si se usa crudo.

Generación 5 — Agentic OCR: orquestar, validar, dudar

La generación actual no es “un modelo mejor”: es una arquitectura que combina las anteriores y les agrega criterio. Así funciona en Quoryks:

  1. Multimodelo en competencia: varios motores (OCR especializado + document AI + LLMs multimodales) procesan el mismo documento. Sus resultados se cruzan: donde todos coinciden, la confianza es alta; donde difieren, se enciende una alarma.
  2. Validación estructural local: el CUIT tiene que pasar el dígito verificador; los netos por alícuota tienen que sumar contra el total; el formato punto de venta + número tiene que ser válido. La aritmética no alucina.
  3. Recuperación agéntica: si un campo falta o quedó dudoso, un agente vuelve al documento con preguntas dirigidas (“¿dónde está la fecha de vencimiento?”) en lugar de rendirse o inventar.
  4. La duda como feature: lo que no pasa las validaciones no se exporta con cara de seguro — se marca, con su puntuación de confianza y el resaltado de dónde salió, para que una persona lo mire en segundos.

El nombre “agentic” viene del punto 3, pero el corazón filosófico es el punto 4: un sistema que sabe cuándo no sabe. Para datos fiscales, esa propiedad vale más que cualquier punto porcentual de precisión bruta.

La tabla resumen

GeneraciónQué haceDónde se rompe
OCR clásicoPíxeles → textoNo estructura nada
PlantillasExtrae por coordenadasCada diseño nuevo o cambiado
Machine learningExtrae por patrones generalesDocumentos locales (IIBB, CAE); confianza sin criterio
LLM multimodalEntiende el documentoAlucinaciones sin controles
Agentic OCROrquesta, valida, recupera y marca lo dudosoNo es magia: ~98%+ con revisión asistida — y lo decimos

Cómo usar esto para evaluar proveedores

Tres preguntas que separan generaciones en cualquier demo:

  1. “¿Qué pasa si el proveedor cambia el diseño de la factura?” — Si la respuesta involucra “actualizar la configuración”, es generación 2.
  2. “Mostrame una percepción de IIBB extraída.” — Separa lo genérico de lo entrenado para Argentina.
  3. “¿Cómo me muestra el sistema un campo del que no está seguro?” — La pregunta reina. Si la respuesta es “nuestro sistema tiene 99,9% de precisión”, están vendiendo generación 3 con marketing de 2026. Si te muestran el campo marcado, la confianza y el origen, estás viendo la generación actual.

¿Querés hacerle las tres preguntas a Quoryks? 50 hojas gratis, sin tarjeta — traé tu comprobante más raro y fijate qué marca y qué no.