데이터 보호

고객의 신뢰를 소중히 여기며 정보를 안전하게 보호하기 위해 노력합니다.

Parsio가 파싱 엔진별로 데이터를 처리하는 방법

Parsio는 하나의 획일적인 파이프라인이 아닙니다. 각 메일함에 맞는 파싱 엔진 — AI Parser, GPT Parser, Template Parser, OCR Converter — 을 선택할 수 있으며, 각각은 실제로 서로 다른 데이터 경로를 거치고, 관여하는 공급업체도 다르거나 아예 없을 수 있습니다. 저희는 각 경우에 정확히 무슨 일이 일어나는지 명확히 밝혀, 그저 믿어 달라고만 하지 않으려 합니다.

이 페이지는 저희의 일반 보안 페이지를 보완하여, 각 엔진이 데이터를 처리하는 방식을 더 자세히 살펴봅니다.

네 가지 엔진, 네 가지 다른 데이터 경로

AI Parser는 사전 학습된, 미리 구축된 추출 모델로 문서를 처리합니다 — 설정도, 프롬프트도, 템플릿도 필요 없습니다. GPT Parser는 레이아웃과 문구가 너무 다양해 고정된 규칙으로 처리할 수 없는 문서를 위해, 문서의 텍스트(또는 OCR로 변환된 버전)와 사용자가 작성한 프롬프트를 대형 언어 모델로 전송합니다. Template Parser는 고정된 필드 위치를 클릭하여 만든 템플릿과 문서를 대조합니다 — AI나 LLM 공급업체는 전혀 관여하지 않습니다. OCR Converter는 스캔본, PDF, 이미지에서 원시 텍스트와 표를 추출하지만, 이를 구조화된 필드로 해석하지는 않습니다.

AI Parser — 사전 학습된 모델, 설정 불필요

AI Parser는 Microsoft Azure Document Intelligence의 사전 구축 모델을 사용하며, 각 모델은 문서 유형(청구서, 영수증, 신분증, 명함, 은행 명세서 등)에 특화되어 있습니다. 프롬프트를 작성하거나 템플릿을 만들 필요가 없습니다 — 모델은 이미 무엇을 찾아야 하는지 알고 있습니다. 자유 텍스트 지시는 어디로도 전송되지 않으며, 문서 자체만 모델에 의해 처리됩니다.

GPT Parser — 사용자의 프롬프트, AI 모델

GPT Parser는 레이아웃이나 문구가 고정된 규칙을 적용하기에는 너무 일관성이 없는 문서를 위해 설계되었습니다. 원하는 필드를 설명하는 프롬프트를 평이한 언어로 작성하면, Parsio는 문서의 원본 텍스트를 추출하고(스캔본이나 이미지인 경우 먼저 OCR을 실행), 그 텍스트와 프롬프트를 추출을 위해 OpenAI로 전송합니다. 이 데이터는 전송 중 암호화되며, OpenAI의 모델을 학습시키는 데 사용되는 일은 절대 없습니다.

Template Parser — AI 미사용, 타사 모델 호출 없음

AI 공급업체를 전혀 관여시키고 싶지 않다면, Template Parser는 진정한 의미의 AI 미사용 경로입니다. 샘플 문서에서 필드 위치를 표시하여 템플릿을 정의하면, 이후 같은 레이아웃을 가진 모든 문서는 Parsio 자체 인프라에서 전적으로 실행되는 규칙 기반 로직을 통해 이 템플릿과 대조됩니다. 이 엔진에서는 OpenAI, Microsoft, Mistral 또는 그 어떤 AI 제공업체에도 문서 내용이 전송되지 않습니다.

OCR Converter — 텍스트 및 표 추출

OCR Converter는 설정에 따라 AWS Textract 또는 Mistral의 OCR을 사용하여 스캔본, PDF, 이미지를 원시 텍스트와 표로 변환합니다. 다른 세 엔진과 달리 결과물을 구조화된 필드로 해석하지 않습니다 — 이는 텍스트 추출 단계로, 흔히 Template Parser나 사용자 자체의 후속 처리에 앞선 구성 요소로 사용됩니다.

학습 및 데이터 보관

  • 저희는 귀하의 데이터로 어떤 모델도 학습시키거나 미세 조정하지 않으며, 귀하의 데이터를 판매하지도 않습니다. 이는 요금제에 따라 달라지는 기능이 아니라 지속적인 약속입니다.
  • OpenAI, Microsoft, Mistral 등 저희 AI 하위 처리업체와의 계약은 추출을 위해 제출된 데이터를 모델 학습에 사용하는 것을 금지하고 있습니다.

암호화 및 전송

저희 AI 하위 처리업체와의 모든 통신은 암호화된 연결(HTTPS/TLS 1.2+)을 통해 이루어지며, 이는 저희 인프라의 다른 모든 부분에 적용하는 것과 동일한 표준입니다.

데이터 분리

각 Parsio 계정의 문서, 템플릿, 결과는 다른 모든 계정과 논리적으로 분리되어 있습니다. 한 고객의 문서를 처리한다고 해서 다른 고객의 데이터가 노출되거나 섞이는 일은 없습니다.

귀하의 통제하에 남는 것

  • 귀하는 데이터 컨트롤러이며, Parsio와 그 하위 처리업체는 오직 귀하의 지시에 따라 데이터 프로세서로서만 활동합니다.
  • 언제든지 문서, 템플릿 또는 계정 전체를 삭제할 수 있습니다.
  • 설정 가능한 보관 정책을 통해 처리된 데이터를 1일에서 180일 사이에 자동으로 삭제할 수 있습니다.
  • 각 문서를 어떤 엔진이 — 그리고 그에 따라 어떤 공급업체가, 있다면 — 처리할지를 메일함별로 선택할 수 있습니다.

자주 묻는 질문

AI 공급업체를 전혀 관여시키고 싶지 않다면 어떤 엔진을 사용해야 하나요?

Template Parser입니다. Parsio 자체 인프라에서 전적으로 실행되는 규칙 기반 필드 위치 매칭이며, OpenAI, Microsoft, Mistral 어디에도 문서 내용이 전송되지 않습니다.

Parsio는 그냥 ChatGPT를 감싼 것뿐인가요?

아닙니다. OpenAI를 호출하는 것은 GPT Parser뿐이며, 그것도 귀하가 그쪽으로 라우팅한 문서에 한해서입니다. AI Parser는 Microsoft의 사전 구축 추출 모델을 사용하고, Template Parser는 AI 공급업체를 전혀 사용하지 않으며, OCR Converter는 텍스트 추출에만 AWS Textract 또는 Mistral을 사용합니다.

AI 제공업체로 원본 파일이 전송되나요, 아니면 추출된 텍스트만 전송되나요?

엔진에 따라 다릅니다. GPT Parser는 추출된 텍스트(원본 또는 OCR 처리된 텍스트)와 프롬프트를 OpenAI로 전송합니다. AI Parser와 OCR Converter는 각 공급업체의 모델을 통해 문서를 직접 처리합니다. Template Parser는 어떤 AI 공급업체에도 문서 내용을 전송하지 않습니다.

긴 문서에 대해 embeddings나 벡터 검색을 사용하나요?

아닙니다. Parsio는 현재 embeddings나 벡터 검색을 사용하지 않습니다 — GPT Parser는 추출된 텍스트와 프롬프트를 직접 전송합니다.

Parsio 직원이 제 문서를 읽을 수 있나요?

고객 데이터에 대한 접근은 최소 권한 원칙에 따라 제한되며, 지원이나 문제 해결에 필요한 범위로 한정되고, 정기적으로 감사됩니다. 자세한 내용은 저희 보안 페이지를 참고하세요.

제 데이터가 Parsio나 그 AI 공급업체의 모델을 개선하는 데 사용되나요?

아닙니다. 저희는 귀하의 데이터로 학습하지 않으며, OpenAI, Microsoft, Mistral 등 저희 AI 하위 처리업체와의 계약에서도 이를 금지하고 있습니다.

문서를 삭제하면 제 데이터는 어떻게 되나요?

즉시 활성 시스템에서 제거되며, 설정하신 보관 기간(1~180일) 내에 백업과 로그에서도 제거됩니다.

궁금한 점이 있으신가요?

자체 보안 또는 공급업체 검토를 위해 더 자세한 정보가 필요하시면 아래로 문의해 주세요 [email protected].