
크게 두 가지로 씁니다
- 배포를 지킵니다. 모든 Flow 변경을 회귀 데이터셋에 돌립니다. 시뮬레이션이 실패하면 배포를 막습니다.
- 개선안을 비교합니다. 후보 수정 두 개를 같은 데이터셋에 나란히 놓고 돌려서 이긴 쪽을 고릅니다.
무엇을 돌릴 수 있나
다음 중 무엇이든 됩니다.- Flow 버전 전체 워크플로우를 처음부터 끝까지.
- Draft 상태 아직 퍼블리시하지 않은 변경.
- 개선 후보 개선 플로우가 내놓은 제안.
- 임의 변형 예를 들어 “같은 Flow 인데 모델만 X로”.
무엇을 얻나
시뮬레이션 실행
앱이나 CLI에서 바로 시작합니다.
Before/after
현재 버전과 나란히 비교합니다.
비용 vs. 품질
작은 모델을 쓰면 품질은 얼마나 떨어지는지, 그 맞교환을 봅니다.
회귀 체크
변경이 예전에 잘 되던 걸 깨뜨렸는지 봅니다.
베이스라인
비교 기준이 될 버전을 고정합니다.
속도와 비용
시뮬레이션은 데이터셋 예시 하나마다 Agent를 한 번씩, 병렬로 돌립니다. 걸리는 시간은 대략 이렇습니다.- 빠른 모델로 예시 50개면 30초에서 1분.
- 500개면 5분에서 10분.
- 5000개면 30분에서 1시간.
시뮬레이션으로 부족할 때
시뮬레이션은 기대 출력이 이미 정해진 예시에만 돌아갑니다. 그래서 다음은 못 합니다.- 처음 보는 트래픽, 즉 안 겪어 본 의도가 어떻게 나올지 예측하기.
- 사람이 깊이 판단해야 하는 품질 문제 잡기.
- 여러 Agent가 서로 대화하는 상호작용을 재현하기.