PDFが届く。中身を見てExcelに転記する。1件15分。これを1日数十件、6拠点で。
そんな現場のリアルから始まった、ある損害調査会社向けOCR業務システムの開発記です。守秘義務を含む内容のため、業務の詳細は一部ぼかしてお伝えします。
手入力15分が積み上がる現場
保険会社から損害調査の依頼が、メール添付のPDFとして届きます。担当者がPDFを開いて、案件番号・契約者・車両情報・工場情報・保険会社の担当者など、十数項目をExcelの管理シートに転記する。1件あたり10〜15分。
これが6拠点で毎日繰り返されていました。「PDFが構造化されたデータで届けばいいのに」という、全国どこの中小企業でもあるあるな課題です。
構成はGmail自動取込 → OCR → 案件管理
最終的に組んだ構成自体はシンプルです。
- Gmail APIで受信メールを5分間隔でポーリング
- PDF添付(Zipやパスワード付きも自動解除)を取り出す
- OCRで項目を抽出
- 担当者がブラウザ上で確認・編集 → 案件として登録
- 報告書・請求書もそのままPDF出力
技術スタックはNext.js + Supabase + Google Cloud Functions(Python)。
ただ、この「OCRで項目を抽出」の1行が、開発の8割を占めることになります。
OCRエンジンを3回乗り換えた
最初はオープンソースのTesseract(無料のOCRエンジン)で試しました。日本語の文字認識自体はそれなりに通るのですが、罫線の多いPDFで項目の対応関係が崩れます。「ここに書いてあるのが担当者名」というレイアウト依存の知識をTesseract側に教える方法がなく、後段の正規表現で力ずくで対応することになる。
次にGoogle Cloud Vision API。文字認識の精度は劇的に上がりました。が、相変わらず「読めた文字列の中から、どれが事故番号でどれが契約者か」を判定するのは別問題で、後段で頑張る構図は変わらない。
最終的に落ち着いたのが、Geminiの軽量モデル(Gemini Flash系)に「このPDFから以下の13項目を抽出してJSONで返して」と直接お願いする構成です。画像も読めるLLMがレイアウトを理解し、構造化データをそのまま返してくれる。前段OCR + 後段パースの二段構えがワンパスで済むようになったのは大きい。コストもFlash系なら1案件あたり1円もかかりません。
「業務OCRをやるなら、もうLLMベース一択でいい」というのが、この案件で得た一番の結論です。
細かい揺れを地道に潰す
LLMで楽になったとはいえ、運用に乗せると細かい揺れは出ます。依頼PDFは縦型と横型の2フォーマットがあって、レイアウトもラベル名も微妙に違う。任せきりにすると、ある日「担当者」と「工場担当者」を取り違えたり、「初度登録」の年だけ拾って月を落としたり、というブレが見つかります。
こういう業務帳票特有のクセは、サンプル数件で動かしているうちは表に出ません。本番に近いボリュームを流して初めて顕在化するので、そこを1件ずつ潰して、最終的に管理画面の数字と突き合わせて差分ゼロになるまで作り込む——というところが、この種のシステムでいちばん地味で、いちばん効いてくる仕事です。
OCR以外の、地味な仕事を全部拾う
OCRさえできれば終わり、ではありません。業務システムを名乗るなら逃げられない仕事がたくさんあります。
- パスワード付きPDFの自動解除(パスワードはメール本文や別メールに書いてある)
- 添付がZipで届いた時の自動展開
- メール取込が失敗した時のリトライキュー(エラーは別テーブルに退避して、管理画面から誰でも再実行できる)
- 6拠点ごとのデータアクセス制御(Supabase RLSで拠点別に絞る)
- 案件ステータスの可視化と検索
地味ですが、ここを雑にやると現場で「結局Excelに戻った」となります。業務システムの成否を分けるのは、ほぼこの周辺の作り込みです。
15分が90秒に
結果として、1件15分かかっていた取り込み作業は、人が触る部分が「OCR結果のチェックと微修正」だけになり、おおむね1〜2分で完了するようになりました。6拠点分のデータも1つの管理画面で扱えるようになり、検索・集計の手間も大きく減っています。
そこから見えたこと
- 業務OCRはもう「Tesseract + 正規表現で力ずく」の時代ではない。LLMに直接構造化データを返させる構成が、精度・開発速度・コストのバランスで一番現実的。
- とはいえ、後処理の正規表現や業務ルールの実装は消えない。「担当者と工場担当者の区別」のような現場固有のロジックは、結局人間が書く必要がある。
- 紙・PDF・メールが業務の中心にいる現場は、自動化の余地がまだまだ大きい。むしろ「全部Excelで回しています」という会社こそ、こういうシステムが効きます。
弊社エンターズラボでは、こうしたPDF・メール起点の業務をAI/OCRで自動化するシステムを、PoCからお手伝いしています。「うちのこの紙作業、どうにかなりませんか?」という入口のご相談、お気軽にお問い合わせください。