Skip to main content
기준 답이 없는 예시는 그냥 질문일 뿐입니다. 품질을 재려면 예시마다 Agent 답을 채점할 방법이 있어야 합니다. Nora는 여러 주석 방식을 지원하니, 도메인에 맞는 걸 고르세요.

주석 종류

정확 매치

Agent 답이 기대 출력과 똑같을 때만 통과합니다. 구조화된 출력(JSON, enum, ID)에만 쓸모가 있습니다.

퍼지 매치

유사도(편집 거리, 의미 유사도, 또는 둘의 혼합)가 임계값을 넘으면 통과합니다. 표현이 좀 달라도 되는 짧은 사실 답변에 좋습니다.

루브릭

Agent 답을 채점할 체크리스트입니다.
루브릭은 판사 모델이 채점합니다. 텍스트 답변에 값싸고 믿을 만합니다.

참조 답변 + 판사

“좋은” 예시 답을 줍니다. 판사 모델이 Agent 답을 그 참조와 견줘 충실도, 완전성, 정확성을 점수 냅니다. 정확 매치는 너무 빡빡하고 루브릭 전체는 품이 너무 클 때 좋은 절충입니다.

커스텀 판사(코드)

Agent 답을 받아 점수와 판정을 돌려주는 작은 JS/Python 함수를 씁니다. 완전히 통제할 수 있어, 채점이 도메인 로직과 얽힐 때 좋습니다(예: “답의 SQL이 기대와 같은 행을 만들어야 함”).

언제 무엇을 쓰나

  • 구조화 출력(함수 호출, JSON) 구조화 필드에는 정확·퍼지 매치.
  • 짧은 사실(“반품 정책이 뭐예요”) 퍼지 매치나 참조 + 판사.
  • 긴 텍스트(설명, 요약) 루브릭.
  • 도메인 특화(SQL, 코드, 계산) 커스텀 판사.
한 데이터셋 안에서 섞어 써도 됩니다. 예시마다 다른 주석 방식을 쓸 수 있습니다.

여러 주석자 합의

주석이 주관적인 데이터셋에는 주석자를 여럿 둡니다. 데이터셋 뷰어가 합의 통계를 보여줍니다. 의견이 많이 갈린 예시는 다시 볼 값이 있죠. Nora는 합의를 강제하지 않습니다. 모든 주석을 보여주고, 시뮬레이션이 어느 주석자의 판정을 쓸지 고르게 합니다.

주석 달기

예시마다 주석 에디터가 있습니다. 한꺼번에 달 수도 있습니다.
  • 일부만 거릅니다(태그, 점수, “미주석”).
  • 같은 루브릭이나 참조를 전부에 적용합니다.
  • 필요하면 낱개로 검토합니다.

피드백에서 주석

신호에 텍스트 교정이 있으면, 데이터셋에 저장할 때 그 교정이 기대 출력에 자동으로 채워집니다. 이미 피드백이 있는 것의 주석 단계를 아껴 줍니다.

주석 검토

검토 중인 데이터셋은 이렇게 표시됩니다.
  • Unannotated 기준 답이 없는 예시. 시뮬레이션에서 채점되지 않습니다.
  • Needs review 피드백에서 자동으로 채워진 것. 사람이 확인해야 합니다.
  • Ready 사람이 주석을 달고 확인한 것.
시뮬레이션은 기본으로 ready 예시만 채점합니다. 더 넓게 시험하고 싶으면 needs review도 포함하도록 켭니다.

나중에 고치기

주석은 버전으로 관리됩니다. 고치면 새 버전이 생기고, 시뮬레이션 결과는 그때 쓴 주석 버전에 묶입니다. 그래서 주석이 바뀌어도 옛 시뮬레이션 결과가 그대로 유효합니다.