
강화 블록
Embed
청크 텍스트를 밀집 벡터로 바꿉니다. 데이터에 맞는 임베딩 제공자를 고릅니다(비영어는 다국어, 큰 청크는 긴 컨텍스트, 비용이 걱정이면 작은 차원). 픽커가 차원, 컨텍스트 창, 1k 토큰당 비용을 보여줘 견줄 수 있습니다. 임베딩이 의미 검색을 가능하게 합니다. 공간에서 더 가까운 벡터가 서로 더 관련 있죠. 청크마다 Output 스토어에 쓰이는vector 필드를 얻습니다.
자동 태그(LLM)
작은 모델에게 청크마다 태그를 달게 합니다. 쓸 수 있는 태그 목록과 짧은 지시를 줍니다. 흔히 이렇게 씁니다.- Domain:
billing,auth,pricing,security - Audience:
internal,customer,developer - Content type:
how-to,reference,troubleshooting
엔티티 추출
이름 붙은 엔티티를 찾아 정규화합니다.- 사람, 조직, 위치.
- 제품, SKU, 프로젝트 코드.
- 날짜와 기간.
- regex나 작은 분류기로 만든 커스텀 엔티티.
언어 감지
청크의 언어를 찾아 메타데이터 필드로 씁니다. Agent마다 언어 필터를 걸 수 있게 해 줍니다.요약 생성기
청크마다 한 단락 요약을 붙입니다. 리트리벌이 전체 청크뿐 아니라 요약으로도 검색할 수 있어, 짧고 키워드 많은 쿼리에서 리콜이 더 나을 수 있습니다.감성 / 유해성
감성 점수와 유해성 플래그를 붙입니다. 지식에 고객 메시지가 있고, 감정 신호로 거르거나 라우팅하고 싶을 때 좋습니다.커스텀 강화기(인라인)
JS/Python 인라인 함수입니다. 청크를 받아 붙일 메타데이터를 돌려줍니다. 여러분 채점 서비스를 부를 때 좋습니다.비용 관리
강화는 비용이 쌓이는 곳입니다. LLM 호출도, 임베딩도 다 돈이죠. 레버가 둘 있습니다.- Batch size 임베딩 API는 배치가 훨씬 쌉니다. 기본 100.
- Skip if unchanged 기본 켜짐. 콘텐츠 해시가 같은 청크는 파이프라인을 다시 돌려도 다시 강화하지 않습니다.