州政府機関
政府文書インテリジェンス
167フィールドの自動抽出、95%以上の精度、60秒以内の処理
文書あたり167フィールド
95%以上の精度
663の自動テスト60秒未満の処理

背景
州政府機関がスキャンされた4ページフォームの手動データ入力に依存していました - 1文書あたり15〜20分、167フィールドで2〜5%のエラー率。
制約
文書には厳格な保護が必要なPIIが含まれていました。スキャン品質は様々でした(傾き、印刷品質の低下、手書き)。規制コンプライアンスは必須でした。
施策
コンセンサス融合、65ゾーンの座標ベースPII墨消し、本番Axum APIを備えたRustによるマルチエンジンOCRシステムを構築 - 663件のテスト付き。
成果概要
167フィールドを60秒未満で95%以上の精度で抽出(16倍高速化)、完全なPIIコンプライアンス、663件の自動テスト - 15週間で納品。
アーキテクチャ
スキャンフォームから構造化・検証済みデータへ
文書前処理
マルチエンジン抽出
PII保護
本番API
技術スタック
コア言語
Rust
クラウド
AWS(ECS Fargate、Textract、S3、Secrets Manager)
APIフレームワーク
Axum
文書処理
TIFF/画像処理、マルチエンジンOCR
デプロイ
Docker、ECS Fargate
テスト
663の自動テスト
成果
167
>95%
<60秒
663
PII不漏出
16倍
