Skip to main content
Agence Gouvernementale d'État

Intelligence Documentaire Gouvernementale

Extraction automatisée de 167 champs par document avec >95% de précision en moins de 60 secondes

167 champs par document

>95% de précision

663 tests automatisés<60s traitement
Étude de cas d'intelligence de documents gouvernementaux, OCR et classification à grande échelle de documents d'archives publiques pour un gouvernement d'état, avec lignée d'audit complète

Contexte

Une agence gouvernementale d'État s'appuyait sur la saisie manuelle de données pour des formulaires numérisés de 4 pages - 15 à 20 minutes par document avec des taux d'erreur de 2 à 5 % sur 167 champs.

Contrainte

Les documents contenaient des PII nécessitant une protection stricte. La qualité de numérisation variait (inclinées, mauvaise impression, manuscrites). La conformité réglementaire était obligatoire.

Intervention

Construit un système OCR multi-moteurs en Rust avec fusion par consensus, rédaction PII basée sur les coordonnées à 65 zones et une API de production Axum - avec 663 tests.

Résultat

167 champs extraits à >95% de précision en moins de 60 secondes (16x plus rapide), conformité PII totale, 663 tests automatisés - livré en 15 semaines.

Architecture

Du formulaire numérisé aux données structurées et validées

Prétraitement des Documents

Les fichiers TIFF/images numérisés sont normalisés, redressés et préparés pour l'extraction. Les documents multi-pages sont divisés et classés pour identifier les sections de formulaire et les emplacements de champs.

Extraction Multi-Moteurs

Plusieurs moteurs d'OCR et d'extraction traitent chaque document indépendamment. Une couche de fusion par consensus valide croisement les résultats par champ, sélectionnant la valeur de plus haute confiance selon le type de champ et les règles de validation.

Protection des PII

65 zones de rédaction calibrées basées sur les coordonnées masquent les champs sensibles. La détection de motifs capture les PII hors des emplacements attendus. Chaque rédaction est vérifiée par rapport aux données de référence dans la suite de tests.

API de Production

API REST basée sur Axum gère la soumission de documents, l'état de traitement et la récupération des résultats. Limitation de débit, journalisation structurée et vérifications de santé assurent la fiabilité en production.

Stack Technique

Langage Principal

Rust

Cloud

AWS (ECS Fargate, Textract, S3, Secrets Manager)

Framework API

Axum

Traitement de Documents

Traitement TIFF/image, OCR multi-moteurs

Déploiement

Docker, ECS Fargate

Tests

663 tests automatisés

Résultats

167

Champs extraits par document

>95%

Précision d'extraction

<60s

Temps de traitement (avant 15-20 min)

663

Tests automatisés

Zéro DPI

Pipeline conforme

16×

Amélioration de vitesse

Advisory Mandate

Vous Préparez un Mandat Comparable ?

Un appel découverte direct pour parler du problème, des contraintes et du chemin le plus crédible pour avancer.

Nous répondons sous 4 heures pendant les heures ouvrables

Le brief opérationnel pour les leaders de l'AI en production

Le brief opérationnel deux fois par jour pour les CTO et fondateurs qui livrent de l'AI en production.