Skip to main content
Enrich 단계는 청크가 리트리벌에 쓸 메타데이터를 얻는 곳입니다. 이 단계의 블록은 더하기만 합니다. 각자 새 필드를 붙이죠.
Enrich 블록 설정 — JavaScript 또는 Python 스크립트로 필드를 뽑아 붙인다

강화 블록

Embed

청크 텍스트를 밀집 벡터로 바꿉니다. 데이터에 맞는 임베딩 제공자를 고릅니다(비영어는 다국어, 큰 청크는 긴 컨텍스트, 비용이 걱정이면 작은 차원). 픽커가 차원, 컨텍스트 창, 1k 토큰당 비용을 보여줘 견줄 수 있습니다. 임베딩이 의미 검색을 가능하게 합니다. 공간에서 더 가까운 벡터가 서로 더 관련 있죠. 청크마다 Output 스토어에 쓰이는 vector 필드를 얻습니다.

자동 태그(LLM)

작은 모델에게 청크마다 태그를 달게 합니다. 쓸 수 있는 태그 목록과 짧은 지시를 줍니다. 흔히 이렇게 씁니다.
  • Domain: billing, auth, pricing, security
  • Audience: internal, customer, developer
  • Content type: how-to, reference, troubleshooting
태그는 거를 수 있는 메타데이터가 됩니다. 필터를 참고하세요.

엔티티 추출

이름 붙은 엔티티를 찾아 정규화합니다.
  • 사람, 조직, 위치.
  • 제품, SKU, 프로젝트 코드.
  • 날짜와 기간.
  • regex나 작은 분류기로 만든 커스텀 엔티티.
찾은 엔티티마다 검색할 수 있는 필드로 붙습니다. “Acme Corp가 나온 청크를 다 보여줘” 같은 검색형 리트리벌 쿼리에 좋습니다.

언어 감지

청크의 언어를 찾아 메타데이터 필드로 씁니다. Agent마다 언어 필터를 걸 수 있게 해 줍니다.

요약 생성기

청크마다 한 단락 요약을 붙입니다. 리트리벌이 전체 청크뿐 아니라 요약으로도 검색할 수 있어, 짧고 키워드 많은 쿼리에서 리콜이 더 나을 수 있습니다.

감성 / 유해성

감성 점수와 유해성 플래그를 붙입니다. 지식에 고객 메시지가 있고, 감정 신호로 거르거나 라우팅하고 싶을 때 좋습니다.

커스텀 강화기(인라인)

JS/Python 인라인 함수입니다. 청크를 받아 붙일 메타데이터를 돌려줍니다. 여러분 채점 서비스를 부를 때 좋습니다.

비용 관리

강화는 비용이 쌓이는 곳입니다. LLM 호출도, 임베딩도 다 돈이죠. 레버가 둘 있습니다.
  • Batch size 임베딩 API는 배치가 훨씬 쌉니다. 기본 100.
  • Skip if unchanged 기본 켜짐. 콘텐츠 해시가 같은 청크는 파이프라인을 다시 돌려도 다시 강화하지 않습니다.
실행 로그가 블록별 강화 비용을 보여줍니다.

순서

강화기는 이은 순서대로 돕니다. 어떤 강화기는 앞 것의 출력을 씁니다. 예를 들어 뽑아낸 엔티티를 하류 태그 분류기의 입력으로 넣죠. 서로 딸린 게 없으면 블록을 자동으로 병렬로 돌려 빠르게 합니다.

Enrich가 안 하는 것

강화 블록은 청크 텍스트 자체를 고치지 않습니다. 메타데이터만 더합니다. 텍스트를 바꿔야 하면(번역, 본문을 요약으로) Normalize에서 커스텀 변환으로 하세요.