Parsio 如何根据不同解析引擎处理您的数据
Parsio 并非单一的通用处理流程。您可以为每个邮箱选择适合的解析引擎——AI Parser、GPT Parser、Template Parser 或 OCR Converter——每种引擎的数据处理路径都截然不同,涉及的供应商也各不相同(有些完全不涉及第三方)。我们希望准确说明每种情况下具体发生了什么,让您无需仅凭信任。
本页面是我们通用 安全 页面的补充,更详细地说明每个引擎如何处理您的数据。
四种引擎,四条不同的数据路径
AI Parser 使用预训练、开箱即用的提取模型处理您的文档——无需配置,无需提示词,无需模板。GPT Parser 会将文档的文本(或其 OCR 版本)与您编写的提示词一起发送给大语言模型,适用于版式和措辞变化过大、无法用固定规则处理的文档。Template Parser 通过点击固定字段位置构建模板,并将文档与之匹配——完全不涉及任何 AI 或 LLM 供应商。OCR Converter 从扫描件、PDF 和图像中提取原始文本和表格,但不会将其解析为结构化字段。
AI Parser — 预训练模型,无需任何配置
AI Parser 使用 Microsoft Azure Document Intelligence 的预构建模型,每个模型都针对特定文档类型(发票、收据、身份证件、名片、银行对账单等)进行了优化。您无需编写提示词或构建模板——模型已经知道要查找什么。系统不会向任何地方发送自由文本指令;模型仅处理文档本身。
GPT Parser — 您的提示词,一个 AI 模型
GPT Parser 专为版式或措辞过于不一致、无法用固定规则处理的文档而设计。您用自然语言编写提示词描述所需字段;Parsio 提取文档的原生文本(如果是扫描件或图像,会先进行 OCR),并将文本和您的提示词发送给 OpenAI 进行提取。这些数据在传输过程中经过加密,且绝不会用于训练 OpenAI 的模型。
Template Parser — 不使用 AI,不调用任何第三方模型
如果您完全不希望涉及任何 AI 供应商,Template Parser 是真正的无 AI 方案:您通过在样本文档上标记字段位置来定义模板,此后任何具有相同版式的文档都会通过完全运行在 Parsio 自有基础设施上的基于规则的逻辑与之匹配。此引擎不会向 OpenAI、Microsoft、Mistral 或任何其他 AI 供应商发送任何文档内容。
OCR Converter — 文本与表格提取
OCR Converter 根据配置使用 AWS Textract 或 Mistral 的 OCR,将扫描件、PDF 和图像转换为原始文本和表格。与其他三种引擎不同,它不会将输出解析为结构化字段——这是一个文本提取步骤,通常作为 Template Parser 或您自己的后续处理之前的基础构建模块使用。
模型训练与数据保留
- 我们绝不会使用您的数据训练或微调任何模型,也绝不会出售您的数据。这是一项长期承诺,而非取决于套餐的功能。
- 我们与 AI subprocessors(OpenAI、Microsoft 和 Mistral)签订的协议禁止他们使用为提取而提交的数据来训练其模型。
加密与传输
与我们的 AI subprocessors 之间的所有通信均通过加密连接(HTTPS/TLS 1.2+)进行,这与我们基础设施其他部分所采用的标准相同。
数据隔离
每个 Parsio 账户的文档、模板和结果都与其他任何账户在逻辑上隔离。处理某位客户的文档绝不会暴露或混入另一位客户的数据。
始终由您掌控的内容
- 您是 Data Controller;Parsio 及其 subprocessors 仅作为 Processors,按照您的指示行事。
- 您可以随时删除任何文档、模板或整个账户。
- 可配置的保留策略让您可以在 1 到 180 天之间自动删除已处理的数据。
- 您可以逐个邮箱选择由哪个引擎——从而决定(如果有的话)哪些供应商——处理每份文档。
常见问题
如果我不想涉及任何 AI 供应商,应该使用哪种引擎?
Template Parser。它基于规则进行字段位置匹配,完全运行在 Parsio 自有基础设施上——不会向 OpenAI、Microsoft 或 Mistral 发送任何文档内容。
Parsio 只是 ChatGPT 的一个封装吗?
不是。只有 GPT Parser 会调用 OpenAI,且仅限于您路由给它的文档。AI Parser 使用 Microsoft 的预构建提取模型,Template Parser 完全不使用任何 AI 供应商,OCR Converter 仅将 AWS Textract 或 Mistral 用于文本提取。
发送给 AI 提供商的是原始文件,还是仅提取的文本?
这取决于所用引擎。GPT Parser 会将提取的文本(原生文本或 OCR 结果)连同您的提示词一起发送给 OpenAI。AI Parser 和 OCR Converter 会通过各自提供商的模型直接处理文档。Template Parser 绝不会向任何 AI 供应商发送文档内容。
对于长文档,你们是否使用 embeddings 或向量检索?
不使用。Parsio 目前不使用 embeddings 或向量检索——GPT Parser 会直接发送提取的文本和您的提示词。
Parsio 的员工能读取我的文档吗?
对客户数据的访问遵循最小权限原则,仅限于支持或故障排查所需的范围,并会定期接受审计。详情请参阅我们的 安全 页面。
我的数据是否会用于改进 Parsio 或其 AI 供应商的模型?
不会。我们不会使用您的数据进行训练,我们与 AI subprocessors(OpenAI、Microsoft 和 Mistral)的合同同样禁止他们这样做。
如果我删除一份文档,我的数据会怎样?
该文档会立即从活跃系统中移除,并在您配置的保留期限(1-180 天)内从备份和日志中移除。
还有疑问?
如果您需要更多细节以完成自己的安全或供应商审查,请联系我们 [email protected].