언제 쓰나
- 회귀 테스트 모든 배포가 데이터셋을 돌려, 사용자보다 먼저 회귀를 잡습니다.
- 시뮬레이션 제안된 개선을 프로덕션이 아니라 데이터셋에서 시험합니다.
- 벤치마킹 Flow 버전, 모델 선택, 프롬프트 변형을 견줍니다.
- 커버리지 Flow가 다뤄야 할 입력 범위를 감당하는지 확인합니다.
데이터셋 종류
Golden set
손으로 고른 맞는 예시. 작고 질이 높습니다.
Holdout
따로 떼어 둔 테스트 데이터. 훈련이나 개선에는 안 쓰고 평가에만 씁니다.
회귀 스위트
예전에 고친 실패의 예시. 회귀를 막습니다.
프로덕션 샘플
프로덕션의 실제 트레이스. 실제 트래픽 품질을 확인합니다.
만드는 방법
데이터셋 만들기
프로덕션 트레이스, 손 작성, 임포트, 클러스터에서.
예시 주석
기대 출력, 루브릭, 판정 라벨을 붙입니다.
커버리지와 버전
커버리지
예시가 프로덕션을 대표하나요?
버전
데이터셋은 시간에 따라 바뀝니다. 버전을 남깁니다.
데이터셋의 한살이
- 씨 뿌리기 예시 10~30개짜리 작은 수동 세트.
- 키우기 고친 클러스터의 실패 트레이스를 새 예시로 더합니다.
- 가지치기 이제 관련 없는 예시를 물립니다(없어진 기능, 낡은 케이스).
- 나누기 커지면 훈련에는 안 쓰고 평가에만 쓰는 홀드아웃을 따로 둡니다.
데이터셋이 사는 곳
워크스페이스의 Reliable → Datasets 아래에 있습니다. 데이터셋마다 이렇게 보여줍니다.- 예시 수.
- 마지막 업데이트.
- 어느 Flow / 개선이 썼는지.
- 커버리지 통계(커버리지 참고).