数据保护

我们珍视您的信任,并努力保护您的信息安全。

Parsio 如何根据不同解析引擎处理您的数据

Parsio 并非单一的通用处理流程。您可以为每个邮箱选择适合的解析引擎——AI Parser、GPT Parser、Template Parser 或 OCR Converter——每种引擎的数据处理路径都截然不同,涉及的供应商也各不相同(有些完全不涉及第三方)。我们希望准确说明每种情况下具体发生了什么,让您无需仅凭信任。

本页面是我们通用 安全 页面的补充,更详细地说明每个引擎如何处理您的数据。

四种引擎,四条不同的数据路径

AI Parser 使用预训练、开箱即用的提取模型处理您的文档——无需配置,无需提示词,无需模板。GPT Parser 会将文档的文本(或其 OCR 版本)与您编写的提示词一起发送给大语言模型,适用于版式和措辞变化过大、无法用固定规则处理的文档。Template Parser 通过点击固定字段位置构建模板,并将文档与之匹配——完全不涉及任何 AI 或 LLM 供应商。OCR Converter 从扫描件、PDF 和图像中提取原始文本和表格,但不会将其解析为结构化字段。

AI Parser — 预训练模型,无需任何配置

AI Parser 使用 Microsoft Azure Document Intelligence 的预构建模型,每个模型都针对特定文档类型(发票、收据、身份证件、名片、银行对账单等)进行了优化。您无需编写提示词或构建模板——模型已经知道要查找什么。系统不会向任何地方发送自由文本指令;模型仅处理文档本身。

GPT Parser — 您的提示词,一个 AI 模型

GPT Parser 专为版式或措辞过于不一致、无法用固定规则处理的文档而设计。您用自然语言编写提示词描述所需字段;Parsio 提取文档的原生文本(如果是扫描件或图像,会先进行 OCR),并将文本和您的提示词发送给 OpenAI 进行提取。这些数据在传输过程中经过加密,且绝不会用于训练 OpenAI 的模型。

Template Parser — 不使用 AI,不调用任何第三方模型

如果您完全不希望涉及任何 AI 供应商,Template Parser 是真正的无 AI 方案:您通过在样本文档上标记字段位置来定义模板,此后任何具有相同版式的文档都会通过完全运行在 Parsio 自有基础设施上的基于规则的逻辑与之匹配。此引擎不会向 OpenAI、Microsoft、Mistral 或任何其他 AI 供应商发送任何文档内容。

OCR Converter — 文本与表格提取

OCR Converter 根据配置使用 AWS Textract 或 Mistral 的 OCR,将扫描件、PDF 和图像转换为原始文本和表格。与其他三种引擎不同,它不会将输出解析为结构化字段——这是一个文本提取步骤,通常作为 Template Parser 或您自己的后续处理之前的基础构建模块使用。

模型训练与数据保留

  • 我们绝不会使用您的数据训练或微调任何模型,也绝不会出售您的数据。这是一项长期承诺,而非取决于套餐的功能。
  • 我们与 AI subprocessors(OpenAI、Microsoft 和 Mistral)签订的协议禁止他们使用为提取而提交的数据来训练其模型。

加密与传输

与我们的 AI subprocessors 之间的所有通信均通过加密连接(HTTPS/TLS 1.2+)进行,这与我们基础设施其他部分所采用的标准相同。

数据隔离

每个 Parsio 账户的文档、模板和结果都与其他任何账户在逻辑上隔离。处理某位客户的文档绝不会暴露或混入另一位客户的数据。

始终由您掌控的内容

  • 您是 Data Controller;Parsio 及其 subprocessors 仅作为 Processors,按照您的指示行事。
  • 您可以随时删除任何文档、模板或整个账户。
  • 可配置的保留策略让您可以在 1 到 180 天之间自动删除已处理的数据。
  • 您可以逐个邮箱选择由哪个引擎——从而决定(如果有的话)哪些供应商——处理每份文档。

常见问题

如果我不想涉及任何 AI 供应商,应该使用哪种引擎?

Template Parser。它基于规则进行字段位置匹配,完全运行在 Parsio 自有基础设施上——不会向 OpenAI、Microsoft 或 Mistral 发送任何文档内容。

Parsio 只是 ChatGPT 的一个封装吗?

不是。只有 GPT Parser 会调用 OpenAI,且仅限于您路由给它的文档。AI Parser 使用 Microsoft 的预构建提取模型,Template Parser 完全不使用任何 AI 供应商,OCR Converter 仅将 AWS Textract 或 Mistral 用于文本提取。

发送给 AI 提供商的是原始文件,还是仅提取的文本?

这取决于所用引擎。GPT Parser 会将提取的文本(原生文本或 OCR 结果)连同您的提示词一起发送给 OpenAI。AI Parser 和 OCR Converter 会通过各自提供商的模型直接处理文档。Template Parser 绝不会向任何 AI 供应商发送文档内容。

对于长文档,你们是否使用 embeddings 或向量检索?

不使用。Parsio 目前不使用 embeddings 或向量检索——GPT Parser 会直接发送提取的文本和您的提示词。

Parsio 的员工能读取我的文档吗?

对客户数据的访问遵循最小权限原则,仅限于支持或故障排查所需的范围,并会定期接受审计。详情请参阅我们的 安全 页面。

我的数据是否会用于改进 Parsio 或其 AI 供应商的模型?

不会。我们不会使用您的数据进行训练,我们与 AI subprocessors(OpenAI、Microsoft 和 Mistral)的合同同样禁止他们这样做。

如果我删除一份文档,我的数据会怎样?

该文档会立即从活跃系统中移除,并在您配置的保留期限(1-180 天)内从备份和日志中移除。

还有疑问?

如果您需要更多细节以完成自己的安全或供应商审查,请联系我们 [email protected].