CanRobot · 캔로봇
Microsoft Certified Trainer Microsoft MVP 2025

M3-2. 평가 Evaluate — 테스트 세트로 품질 측정

한 줄 요약Evaluate 탭은 Preview의 수동 테스트를 구조화된 테스트 세트로 대체합니다. 대화(테스트 케이스)를 만들어 실행하면 정량 점수가 나오고, 실행 간 비교로 “변경이 품질을 개선했는가”를 추적합니다. (기능·화면·명칭은 프리뷰 기준 · subject to change)

1. 핵심 개념 4가지

개념 정의 비고
Conversation 처리해야 할 시나리오를 나타내는 테스트 케이스 — 사용자 메시지 + (선택) 기대 응답 수동 작성 / AI 생성 / CSV 업로드
Evaluation 대화들과 테스트 방법을 묶은 이름 있는 테스트 세트 — 실행 시 점수화된 결과 생성 Evaluate 탭에서 관리
Test method 현재 General quality만 제공 — AI가 관련성(relevance)·완전성(completeness) 평가 기대 응답과의 비교는 하지 않음
User profile 평가를 실행할 인증 프로필 도구·연결까지 온전히 테스트 가능

수동 테스트와의 차이 — Preview는 매번 수동·정성적·시나리오 1개씩이지만, 평가는 반복 가능·정량 점수·다수 대화 일괄·시간 경과 개선 추적이 가능합니다.

2. 테스트 세트 만들기 — 3가지 방법

평가 사이클 — 테스트 세트로 반복 측정

방법 1 — CSV 업로드: Evaluate 탭 → Data source 섹션에 CSV 드래그 또는 찾아보기 → 가져온 대화 검토 → 우측 Configure test set 패널에서 Name 입력 → Evaluate(즉시 실행) 또는 Save(저장만). 템플릿은 CSV 링크로 다운로드. 최대 파일 크기 5 MB, 지정 형식 준수.

방법 2 — AI 생성: More ways to start 섹션 → Quick conversation set 선택 → 에이전트의 설명·지침·토픽 기반으로 대화 10개 자동 생성Review your test cases 목록에서 검토. 추가 생성은 Add conversations → Generate 10 conversations, 최초 평가 실행 후에는 Generate 25 / 50 옵션 제공.

방법 3 — 수동 작성: Or, write some questions yourselfAdd conversations → Write → 대화마다 사용자 질문(필수) + (선택) 기대 에이전트 응답 입력.

Configure test set 패널 필드

필드 설명 필수
Name 평가 이름
Test method 채점 방법 — 기본 General quality 아니오
User profile 실행 인증 프로필 — Manage로 구성 아니오

기존 테스트 세트는 Evaluation 드롭다운에서 열어 대화 편집·추가 후 Save합니다.

3. 평가 실행과 재실행

  1. Evaluate 탭 → Evaluation 드롭다운에서 실행할 평가 선택(대화 1개 이상 필요)
  2. Configure test set 패널에서 Name·Test method 확인 → Evaluate 선택
  3. 각 대화가 처리됩니다 — 대화 수에 비례해 수 분 걸릴 수 있음
  4. 각 실행(run)은 개별 저장되어 실행 간 비교 가능

재실행 — 지침·지식·도구를 수정한 뒤 Recent results 아래 Evaluate test set again (또는 테스트 세트 내 Evaluate test set 아이콘)으로 다시 실행하고 이전 실행과 비교해 변경 영향을 측정합니다.

💳 과금 주의 — GitHub Copilot 하네스에서는 게시 후 사용뿐 아니라 빌드·테스트·평가에도 사용량 과금이 적용되어, 평가 실행(AI 대화 생성 포함)도 Copilot Credits를 소모합니다. 대규모 테스트 세트의 반복 재실행은 사용량을 감안해 계획하세요. 👉 M3-7 과금 — Copilot Credits

4. 결과 보기와 조치

Recent results에서 실행 이력이 있는 평가를 선택하면:

  • 테스트 실행 결과 표: 대화 ID/번호 · 메시지 수 · General quality 점수 (대화 선택 시 상세)
  • Evaluation summary: Score(통과 대화 전체 점수) · Duration · Test cases 수 · Data type(현재 Conversation만) · User profile
  • Test case details: User messages · Agent responses · General quality — Pass 또는 Fail 이진 판정
  • 내보내기: (…) > Export test results → 전체 대화·응답·점수가 담긴 CSV 다운로드
결과 문제 조치
General quality 점수 낮음 지침(Instructions) 검토·정제
도구 누락/오호출 도구 설명 점검, 지침에 도구 사용 언급
잘못된 정보 지식 소스 추가·구성 검증

핵심 정리

  1. 평가 = Conversation + Test method(General quality) + User profile — 기대 응답 비교가 아니라 관련성·완전성 채점(Pass/Fail)
  2. 수치 기억: CSV 5 MB · AI 생성 기본 10개(최초 실행 후 25/50) · 실행별 개별 저장 · CSV 내보내기
  3. 운영 루프: 실행 → 결과 분석 → 지침·지식·도구 조정 → 재실행 비교 — 변경 효과를 객관적으로 측정하되, 평가 실행도 Copilot Credits를 소모함을 기억

이전: 미리보기 Preview · M3 운영으로 → 다음: 출판 및 배포

출처: Evaluate an agent (MS Learn) · Create a test set for an agent (MS Learn) · Run an evaluation for an agent (MS Learn) · View evaluation results for an agent (MS Learn) · Billing for agents powered by the GitHub Copilot harness (MS Learn)