Volver al glosario
Bancario / Técnico LATAM

OCR

También conocido como: Optical Character Recognition, Reconocimiento Óptico de Caracteres

Definición

OCR (Optical Character Recognition) es la tecnología que convierte imágenes de texto (escaneos, fotos) en texto digital editable y searchable. Usada para procesar PDFs escaneados de estados de cuenta.

Contexto LATAM

En LATAM muchos bancos regionales y algunos formatos viejos entregan PDFs escaneados (no nativos digitales). OCR es necesario para extraer datos de estos documentos. La precisión moderna en español supera 98% en escaneos de buena calidad.

Ejemplo concreto

Un PDF escaneado de Banco del Bajío de 2018 se procesa con OCR primero (convirtiendo la imagen en texto) y luego con parsing estructurado (interpretando el layout de columnas como movimientos).

Cómo aparece en tu estado de cuenta

El OCR no aparece en el estado: es lo que hace falta para leerlo cuando el PDF es una imagen. Si al abrir el archivo no podés seleccionar el texto con el cursor, ese PDF necesita OCR. Es el caso típico del estado que te imprimieron en sucursal y escaneaste, o de la foto tomada con el teléfono.

¿Cómo lo maneja finO$?

finO$ aplica OCR automáticamente cuando detecta un PDF escaneado o de baja calidad. Para PDFs nativos (mayoría de bancos modernos) salta OCR y va directo a parsing estructurado, mejorando velocidad y precisión.

Términos relacionados

¿Necesitas convertir estados de cuenta bancarios a datos estructurados?

¿Solo un archivo? Usa el convertidor para convertir estado de cuenta a Excel gratis.

Preguntas frecuentes sobre OCR

¿Cómo sé si mi estado de cuenta necesita OCR?

Abrí el PDF e intentá seleccionar un número con el cursor. Si podés seleccionarlo y copiarlo, el archivo tiene capa de texto y no hace falta OCR. Si el intento selecciona un recuadro de imagen, el documento es una foto del estado y hay que reconocer los caracteres.

¿Qué tan confiable es el OCR con importes?

Depende mucho de la calidad del origen. Un escaneo derecho y bien iluminado alcanza precisiones muy altas; una foto torcida de una hoja arrugada, no. Los errores típicos no son aleatorios: confusión entre 0 y O, entre 1 y 7, y separadores de miles mal leídos, que son justo los que más daño hacen en un importe.

¿El OCR entiende la estructura de la tabla o solo las letras?

Reconocer caracteres y reconstruir la tabla son dos problemas distintos. Un OCR puede leer bien cada número y aun así asignarlo a la columna equivocada si la tabla no tiene bordes. Por eso importa tanto la validación posterior: que los saldos cuadren fila a fila.