Skip to main content
Agencia Gubernamental Estatal

Inteligencia Documental Gubernamental

Extracción automatizada de 167 campos por documento con >95% de precisión en menos de 60 segundos

167 campos por documento

>95% de precisión

663 pruebas automatizadas<60s procesamiento
Caso de estudio de inteligencia de documentos gubernamentales, OCR y clasificación a gran escala de documentos de registros públicos para un gobierno estatal, con linaje de auditoría completo

Contexto

Una agencia gubernamental estatal dependía del ingreso manual de datos de formularios escaneados de 4 páginas - 15-20 minutos por documento con tasas de error del 2-5% en 167 campos.

Restricción

Los documentos contenían PII que requería protección estricta. La calidad del escaneo variaba (inclinados, baja calidad de impresión, escritura manual). El cumplimiento regulatorio era obligatorio.

Intervención

Construimos un sistema OCR multi-motor en Rust con fusión por consenso, redacción de PII basada en coordenadas con 65 zonas y una API de producción Axum - con 663 pruebas.

Resultado

167 campos extraídos con >95% de precisión en menos de 60 segundos (16x más rápido), cumplimiento total de PII, 663 pruebas automatizadas - entregado en 15 semanas.

Arquitectura

Del formulario escaneado a datos estructurados y validados

Preprocesamiento de Documentos

Los archivos TIFF/imagen escaneados se normalizan, enderezan y preparan para la extracción. Los documentos de múltiples páginas se dividen y clasifican para identificar secciones del formulario y ubicaciones de campos.

Extracción Multi-Motor

Múltiples motores de OCR y extracción procesan cada documento de forma independiente. Una capa de fusión por consenso valida cruzadamente los resultados por campo, seleccionando el valor de mayor confianza según el tipo de campo y las reglas de validación.

Protección de PII

65 zonas de redacción calibradas basadas en coordenadas enmascaran campos sensibles. La detección de patrones captura PII fuera de ubicaciones esperadas. Cada redacción se verifica contra datos de referencia en el conjunto de pruebas.

API de Producción

API REST basada en Axum maneja envío de documentos, estado de procesamiento y recuperación de resultados. Limitación de velocidad, registro estructurado y verificaciones de salud aseguran la confiabilidad en producción.

Stack Tecnológico

Lenguaje Principal

Rust

Nube

AWS (ECS Fargate, Textract, S3, Secrets Manager)

Framework API

Axum

Procesamiento de Documentos

Procesamiento TIFF/imagen, OCR multi-motor

Despliegue

Docker, ECS Fargate

Pruebas

663 pruebas automatizadas

Resultados

167

Campos extraídos por documento

>95%

Precisión de extracción

<60s

Tiempo de procesamiento (antes 15-20 min)

663

Pruebas automatizadas

Cero IPI

Pipeline conforme

16×

Mejora de velocidad

Advisory Mandate

¿Planeando un Mandato Similar?

Una llamada de descubrimiento directa para hablar del problema, las restricciones y la vía más creíble para avanzar.

Respondemos en un plazo de 4 horas durante el horario laboral

El brief operativo para líderes de AI en producción

El brief operativo dos veces al día para CTOs y fundadores que lanzan AI en producción.