주석 종류
정확 매치
Agent 답이 기대 출력과 똑같을 때만 통과합니다. 구조화된 출력(JSON, enum, ID)에만 쓸모가 있습니다.퍼지 매치
유사도(편집 거리, 의미 유사도, 또는 둘의 혼합)가 임계값을 넘으면 통과합니다. 표현이 좀 달라도 되는 짧은 사실 답변에 좋습니다.루브릭
Agent 답을 채점할 체크리스트입니다.참조 답변 + 판사
“좋은” 예시 답을 줍니다. 판사 모델이 Agent 답을 그 참조와 견줘 충실도, 완전성, 정확성을 점수 냅니다. 정확 매치는 너무 빡빡하고 루브릭 전체는 품이 너무 클 때 좋은 절충입니다.커스텀 판사(코드)
Agent 답을 받아 점수와 판정을 돌려주는 작은 JS/Python 함수를 씁니다. 완전히 통제할 수 있어, 채점이 도메인 로직과 얽힐 때 좋습니다(예: “답의 SQL이 기대와 같은 행을 만들어야 함”).언제 무엇을 쓰나
- 구조화 출력(함수 호출, JSON) 구조화 필드에는 정확·퍼지 매치.
- 짧은 사실(“반품 정책이 뭐예요”) 퍼지 매치나 참조 + 판사.
- 긴 텍스트(설명, 요약) 루브릭.
- 도메인 특화(SQL, 코드, 계산) 커스텀 판사.
여러 주석자 합의
주석이 주관적인 데이터셋에는 주석자를 여럿 둡니다. 데이터셋 뷰어가 합의 통계를 보여줍니다. 의견이 많이 갈린 예시는 다시 볼 값이 있죠. Nora는 합의를 강제하지 않습니다. 모든 주석을 보여주고, 시뮬레이션이 어느 주석자의 판정을 쓸지 고르게 합니다.주석 달기
예시마다 주석 에디터가 있습니다. 한꺼번에 달 수도 있습니다.- 일부만 거릅니다(태그, 점수, “미주석”).
- 같은 루브릭이나 참조를 전부에 적용합니다.
- 필요하면 낱개로 검토합니다.
피드백에서 주석
신호에 텍스트 교정이 있으면, 데이터셋에 저장할 때 그 교정이 기대 출력에 자동으로 채워집니다. 이미 피드백이 있는 것의 주석 단계를 아껴 줍니다.주석 검토
검토 중인 데이터셋은 이렇게 표시됩니다.- Unannotated 기준 답이 없는 예시. 시뮬레이션에서 채점되지 않습니다.
- Needs review 피드백에서 자동으로 채워진 것. 사람이 확인해야 합니다.
- Ready 사람이 주석을 달고 확인한 것.
ready 예시만 채점합니다. 더 넓게 시험하고 싶으면 needs review도 포함하도록 켭니다.