비교 뷰
데이터셋 예시마다 이렇게 놓입니다.- 왼쪽 베이스라인 출력.
- 가운데 타겟 출력.
- 오른쪽 기대 출력.
- 판정
improvement/regression/same/both failed.
- 개선 먼저 타겟이 베이스라인을 이긴 곳.
- 회귀 먼저 타겟이 베이스라인은 처리하던 걸 깨뜨린 곳.
- Diff 점수 어느 쪽으로든 가장 크게 달라진 곳.
요약 지표
맨 위에 이런 값이 뜹니다.- 통과율 델타 타겟 통과율에서 베이스라인 통과율을 뺀 값.
- 개선 타겟이 베이스라인을 이긴 건수.
- 회귀 타겟이 베이스라인보다 나빠진 건수.
- Wash 판정이 같은 건수.
- 비용 델타 타겟이 더 비싼지 싼지.
- 지연 델타 타겟이 더 느린지 빠른지.
회귀 파고들기
회귀가 발목을 잡습니다. View regressions를 누르면 그 예시만 봅니다. 회귀마다 이렇게 보여줍니다.- 베이스라인이 뭐라고 했는지.
- 타겟이 지금 뭐라고 하는지(나빠진 쪽).
- 왜 바뀌었는지. Nora가 트레이스를 자동으로 diff 해서 어느 스텝이 갈라졌는지 짚어 줍니다.
- 새 프롬프트가 너무 간결해져서 꼭 넣어야 할 면책 문구가 빠짐.
- 새 리트리벌 프리셋이 베이스라인이 기대던 소스를 빠뜨림.
- 모델을 바꾸면서 가장자리 동작이 달라짐.
개선 파고들기
개선도 비슷하게 봅니다. 타겟이 왜 이겼는지 알아야 그 이유를 넓게 적용할 수 있습니다.- 변경이 노린 특정 패턴 덕분이었나?
- 아니면 여러 예시를 두루 끌어올렸나?
통계적 유의성
예시가 50개보다 적으면 Nora가 “high variance, proceed with caution” 을 띄웁니다. 표본이 작으면 잡음을 신호로 착각하기 쉽습니다. 50개가 넘으면 제대로 된 유의성 검정을 보여줍니다. 통과율 델타의 p-값과 신뢰 구간입니다. 잡음 바닥을 벗어난 델타만 믿으세요.변경 출처 표시
개선 플로우는 모든 시뮬레이션에 그 타겟을 만든 제안을 태그로 붙입니다. Before/after가 그 태그를 물려받으니 이렇게 되짚을 수 있습니다.“Improvement #42 (리트리벌 프리셋 변경): 통과율 +8%, 회귀 +1, 지연 +0.02s”무엇이 왜 바뀌었는지 감사 기록을 쌓기 좋습니다.