Skip to main content
州政府機関

政府文書インテリジェンス

167フィールドの自動抽出、95%以上の精度、60秒以内の処理

文書あたり167フィールド

95%以上の精度

663の自動テスト60秒未満の処理
政府文書インテリジェンスケーススタディ、州政府向けの公文書の大規模OCR・分類、完全な監査リネージ付き

背景

州政府機関がスキャンされた4ページフォームの手動データ入力に依存していました - 1文書あたり15〜20分、167フィールドで2〜5%のエラー率。

制約

文書には厳格な保護が必要なPIIが含まれていました。スキャン品質は様々でした(傾き、印刷品質の低下、手書き)。規制コンプライアンスは必須でした。

施策

コンセンサス融合、65ゾーンの座標ベースPII墨消し、本番Axum APIを備えたRustによるマルチエンジンOCRシステムを構築 - 663件のテスト付き。

成果概要

167フィールドを60秒未満で95%以上の精度で抽出(16倍高速化)、完全なPIIコンプライアンス、663件の自動テスト - 15週間で納品。

アーキテクチャ

スキャンフォームから構造化・検証済みデータへ

文書前処理

スキャンされたTIFF/画像ファイルを正規化、傾き補正し、抽出の準備をします。複数ページの文書を分割・分類し、フォームセクションとフィールド位置を識別します。

マルチエンジン抽出

複数のOCRおよび抽出エンジンが各文書を独立して処理します。コンセンサス融合レイヤーがフィールドごとに結果をクロスバリデーションし、フィールドタイプとバリデーションルールに基づいて最も高い信頼度の値を選択します。

PII保護

65の較正された座標ベースの墨消しゾーンが機密フィールドをマスクします。パターン検出が予期される場所の外のPIIを捕捉します。すべての墨消しはテストスイートで正解データに対して検証されます。

本番API

AxumベースのREST APIが文書送信、処理ステータス、結果取得を管理します。レート制限、構造化ログ、ヘルスチェックが本番環境の信頼性を確保します。

技術スタック

コア言語

Rust

クラウド

AWS(ECS Fargate、Textract、S3、Secrets Manager)

APIフレームワーク

Axum

文書処理

TIFF/画像処理、マルチエンジンOCR

デプロイ

Docker、ECS Fargate

テスト

663の自動テスト

成果

167

文書あたりの抽出フィールド

>95%

抽出精度

<60秒

処理時間(以前は15〜20分)

663

自動テスト

PII不漏出

コンプライアンス対応

16倍

速度向上

Advisory Mandate

近いテーマをご検討中ですか?

課題、制約、そして最も現実的な前進の道筋について、直接話すためのディスカバリーコールです。

営業時間内は4時間以内にご返信いたします

本番AIリーダーのための運用ブリーフ

本番AIを出荷するCTOと創業者のための、1日2回の運用ブリーフです。