Skip to main content
데이터셋은 에이전트를 돌려 볼 예시 묶음입니다. 예시 하나는 입력(질문, 작업, 페이로드)과 기대 출력(맞는 답, “이 중 아무거나 되는” 목록, 또는 그냥 루브릭)의 쌍입니다. 데이터셋은 에이전트 품질을 객관적으로 재는 방법입니다. 데이터셋이 없으면 “이 변경이 도움이 됐나” 는 감입니다. 있으면 숫자죠.

언제 쓰나

  • 회귀 테스트 모든 배포가 데이터셋을 돌려, 사용자보다 먼저 회귀를 잡습니다.
  • 시뮬레이션 제안된 개선을 프로덕션이 아니라 데이터셋에서 시험합니다.
  • 벤치마킹 Flow 버전, 모델 선택, 프롬프트 변형을 견줍니다.
  • 커버리지 Flow가 다뤄야 할 입력 범위를 감당하는지 확인합니다.

데이터셋 종류

Golden set

손으로 고른 맞는 예시. 작고 질이 높습니다.

Holdout

따로 떼어 둔 테스트 데이터. 훈련이나 개선에는 안 쓰고 평가에만 씁니다.

회귀 스위트

예전에 고친 실패의 예시. 회귀를 막습니다.

프로덕션 샘플

프로덕션의 실제 트레이스. 실제 트래픽 품질을 확인합니다.
넷 다 목적만 다른 데이터셋일 뿐입니다. Nora가 종류를 따로 강제하지는 않습니다. 역할로 태그해 두면 알맞게 쓰기 쉬워집니다.

만드는 방법

데이터셋 만들기

프로덕션 트레이스, 손 작성, 임포트, 클러스터에서.

예시 주석

기대 출력, 루브릭, 판정 라벨을 붙입니다.

커버리지와 버전

커버리지

예시가 프로덕션을 대표하나요?

버전

데이터셋은 시간에 따라 바뀝니다. 버전을 남깁니다.

데이터셋의 한살이

  1. 씨 뿌리기 예시 10~30개짜리 작은 수동 세트.
  2. 키우기 고친 클러스터의 실패 트레이스를 새 예시로 더합니다.
  3. 가지치기 이제 관련 없는 예시를 물립니다(없어진 기능, 낡은 케이스).
  4. 나누기 커지면 훈련에는 안 쓰고 평가에만 쓰는 홀드아웃을 따로 둡니다.
건강한 Flow는 주요 의도마다 예시가 100~1000개쯤 됩니다. 성장은 자연스럽게 일어납니다. 개선 플로우가 클러스터를 고칠 때마다 예시가 더해지니까요.

데이터셋이 사는 곳

워크스페이스의 Reliable → Datasets 아래에 있습니다. 데이터셋마다 이렇게 보여줍니다.
  • 예시 수.
  • 마지막 업데이트.
  • 어느 Flow / 개선이 썼는지.
  • 커버리지 통계(커버리지 참고).