Choorai
AI Extension · Quality

평가 하네스 만들기

AI 기능을 배포하기 전에 같은 입력에서 같은 기준으로 검증할 수 있는 하네스를 만듭니다.

사용 타이밍

프롬프트, 모델, RAG 데이터, chunk 전략을 바꾸기 전에 먼저 만드세요.

평가 하네스 설계 프롬프트

복사해서 사용하세요

"AI 기능의 평가 하네스를 만들고 싶어. 아래 정보를 바탕으로 golden set, 채점 기준, 실행 명령, 실패 리포트 포맷을 설계해줘. [기능 설명] - 기능: [예: 문서 기반 고객지원 답변] - 입력 형태: [예: 사용자 질문 + 사용자 등급] - 출력 형태: [예: 답변 + 출처 배열] - 반드시 지켜야 할 정책: [예: 출처 없으면 답변 금지] [출력 요구사항] 1) eval case JSON 스키마 2) 최소 golden set 20개 구성 기준 3) pass/partial/fail 채점 기준 4) CI에서 실행할 명령 5) 실패 리포트 Markdown 템플릿"

위 프롬프트를 복사하여 AI 채팅에 붙여넣으세요.

케이스 포맷 예시

eval-case.json
{
  "id": "source-required-001",
  "input": "환불 규정 알려줘",
  "expected": ["환불 가능 기간 포함", "출처 포함"],
  "forbidden": ["출처 없이 단정", "정책 문서에 없는 내용"]
}

실행 체크리스트

0/5 완료

TL;DR

  • 평가 하네스 작업 시 필요한 최소 기준과 검증 포인트를 빠르게 확인합니다.
  • 실제 프로젝트 환경값(브랜치, 시크릿, URL, 임계치)은 팀 기준에 맞게 치환하세요.

사전 준비 (Prerequisites)

  • 대상 리포지토리와 실행 환경 접근 권한 확인
  • 로컬/CI에서 사용할 기본 명령어(`install`, `build`, `test`) 점검
  • 환경변수/시크릿/배포 대상 정보를 최신 상태로 정리

실행 순서 (Steps)

  1. 변경 목표와 범위를 한 줄로 고정한다.
  2. 핵심 변경(평가 하네스)을 최소 단위 커밋으로 적용한다.
  3. 검증 로그를 남기고 체크리스트/문서를 즉시 업데이트한다.

검증 (Validation)

  • 빌드/테스트가 현재 브랜치에서 재현 가능하게 통과하는지 확인
  • 핵심 경로(사용자 플로우 또는 운영 플로우)를 수동 샘플 점검
  • ko/en 문서와 링크가 동일 의도를 유지하는지 대조

문제 해결 (Troubleshooting)

  • 오류 발생 시 로그/요청 본문/환경값을 먼저 캡처한다.
  • 권한/환경변수/라우팅/빌드 산출물 순서로 원인을 좁힌다.
  • 임시 조치와 근본 원인 수정을 분리해 기록한다.

관련 문서 (References)

관련 문서

마지막 업데이트: 2026년 6월 22일 · 버전: v0.0.1

피드백 보내기

입력한 내용으로 새 이슈 페이지를 엽니다.

GitHub 이슈로 보내기