Parsio が parsing engine ごとにデータを処理する方法
Parsio は単一の画一的なパイプラインではありません。お客様は各メールボックスに合わせて parsing engine — AI Parser、GPT Parser、Template Parser、OCR Converter — を選択でき、それぞれ本当に異なるデータの経路をたどり、関与するベンダーも異なります(まったく関与しない場合もあります)。各ケースで何が起きるかを正確にお伝えし、信じていただくだけで終わらせないようにしています。
このページは、一般的な セキュリティ ページを補完し、各エンジンがどのようにデータを扱うかを詳しく説明します。
4つのエンジン、4つの異なるデータ経路
AI Parser は、事前学習済みで構築済みの抽出モデルで文書を処理します — 設定不要、プロンプト不要、テンプレート不要です。GPT Parser は、レイアウトや文言が多様すぎて固定ルールでは対応できない文書向けに、文書のテキスト(またはその OCR 版)とお客様が作成したプロンプトを大規模言語モデルに送信します。Template Parser は、固定フィールド位置をクリックして作成したテンプレートと文書を照合します — AI や LLM のベンダーは一切関与しません。OCR Converter は、スキャン、PDF、画像から生のテキストと表を抽出しますが、それらを構造化フィールドとして解釈することはありません。
AI Parser — 事前学習済みモデル、設定不要
AI Parser は、Microsoft Azure Document Intelligence の構築済みモデルを使用し、それぞれ文書の種類(請求書、領収書、身分証明書、名刺、銀行取引明細書など)に特化しています。プロンプトを書いたりテンプレートを作成したりする必要はありません — モデルはすでに何を探すべきか把握しています。フリーテキストの指示はどこにも送信されず、文書自体だけがモデルによって処理されます。
GPT Parser — お客様のプロンプト、AI モデル
GPT Parser は、レイアウトや文言が固定ルールには不規則すぎる文書向けに構築されています。お客様は、必要なフィールドを説明する平易な言葉でプロンプトを作成します。Parsio は文書のネイティブテキストを抽出し(スキャンや画像の場合はまず OCR を実行し)、そのテキストとプロンプトを抽出のために OpenAI に送信します。このデータは転送中に暗号化され、OpenAI のモデルの学習に使われることは一切ありません。
Template Parser — AI 不使用、サードパーティモデル呼び出しなし
AI ベンダーをまったく関与させたくない場合、Template Parser は真に AI を使わない選択肢です。サンプル文書上でフィールド位置をマークしてテンプレートを定義すると、そのレイアウトを持つ将来のすべての文書が、Parsio 自身のインフラ上で完全に実行されるルールベースのロジックによって照合されます。このエンジンでは、OpenAI、Microsoft、Mistral、その他いかなる AI プロバイダーにも文書コンテンツは送信されません。
OCR Converter — テキストと表の抽出
OCR Converter は、設定に応じて AWS Textract または Mistral の OCR を使用し、スキャン、PDF、画像を生のテキストと表に変換します。他の3つのエンジンのように出力を構造化フィールドとして解釈することはありません — これはテキスト抽出のステップであり、Template Parser の前段階やお客様独自の後続処理の構成要素としてよく使われます。
学習とデータ保持
- 当社はお客様のデータを使って一切モデルを学習・微調整することはなく、データを販売することもありません。これはプランに依存する機能ではなく、恒常的な約束です。
- AI subprocessors(OpenAI、Microsoft、Mistral)との契約では、抽出のために送信されたデータをモデルの学習に使用することを禁止しています。
暗号化と転送
AI subprocessors とのすべての通信は暗号化された接続(HTTPS/TLS 1.2+)で行われ、これは当社インフラの他のあらゆる部分に適用しているのと同じ基準です。
データの分離
各 Parsio アカウントの文書、テンプレート、結果は、他のすべてのアカウントから論理的に分離されています。ある顧客の文書を処理しても、別の顧客のデータが露出したり混ざったりすることはありません。
お客様の管理下にとどまるもの
- お客様が Data Controller であり、Parsio とその subprocessors はお客様の指示に基づく Processors としてのみ機能します。
- 文書、テンプレート、またはアカウント全体をいつでも削除できます。
- 設定可能な保持ポリシーにより、処理済みデータを 1日から180日の間 で自動削除できます。
- どのエンジン — したがってどのベンダーが(あれば)関与するか — を、メールボックスごとに選択できます。
よくある質問
AI ベンダーをまったく関与させたくない場合、どのエンジンを使うべきですか?
Template Parser です。Parsio 自身のインフラ上で完全に実行される、ルールベースのフィールド位置照合であり、OpenAI、Microsoft、Mistral のいずれにも文書コンテンツは送信されません。
Parsio は単なる ChatGPT のラッパーですか?
いいえ。OpenAI を呼び出すのは GPT Parser のみで、しかもお客様がそこにルーティングした文書に限られます。AI Parser は Microsoft の構築済み抽出モデルを使用し、Template Parser は AI ベンダーをまったく使用せず、OCR Converter はテキスト抽出のみに AWS Textract または Mistral を使用します。
AI プロバイダーに送信されるのは元のファイルですか、それとも抽出済みテキストだけですか?
エンジンによって異なります。GPT Parser は抽出済みテキスト(ネイティブまたは OCR 済み)とプロンプトを OpenAI に送信します。AI Parser と OCR Converter は、それぞれのプロバイダーのモデルを通じて文書を直接処理します。Template Parser は、いかなる AI ベンダーにも文書コンテンツを送信しません。
長い文書に対して embeddings やベクター検索を使用していますか?
いいえ。Parsio は現在 embeddings やベクター検索を使用していません — GPT Parser は抽出したテキストとプロンプトを直接送信します。
Parsio の従業員が私の文書を読むことはありますか?
顧客データへのアクセスは least privilege(最小権限の原則)により制限されており、サポートやトラブルシューティングに必要な範囲に限定され、定期的に監査されています。詳細は セキュリティ ページをご覧ください。
私のデータは Parsio や AI プロバイダーのモデルの改善に使われますか?
いいえ。当社はお客様のデータで学習を行わず、AI subprocessors(OpenAI、Microsoft、Mistral)との契約でも同様に禁止されています。
文書を削除すると、そのデータはどうなりますか?
アクティブなシステムからは即座に削除され、バックアップとログからは設定した保持期間内(1〜180日)に削除されます。
ご質問がありますか?
セキュリティレビューやベンダー審査のためにさらに詳しい情報が必要な場合は、以下までお問い合わせください [email protected].