Skip to main content
관리자 › 평가
평가 기능은 AI 응답의 품질을 피드백(수동) · 아레나·리더보드 · 자동 평가 세 가지 방식으로 측정합니다.
  • 사용자의 직접 피드백, 모델 간 블라인드 비교, LLM 기반 자동 채점을 결합하여 체계적인 품질 관리 체계를 구축할 수 있습니다.
  • 측정에서 문제가 드러나면 **추적(Tracing)**으로 그 요청의 처리 과정을 단계별로 들여다보며 원인을 진단합니다.

평가 방식

품질을 측정하는 세 방식과, 드러난 문제의 원인을 진단하는 추적으로 구성됩니다.
  • 측정은 무엇이 나쁜지를, 추적은 왜 그런지를 알려줍니다.

세부 가이드

목적에 맞는 페이지로 이동하세요.

피드백 (수동 평가)

좋아요·싫어요·코멘트 수집, 조회, 관리

아레나 · 리더보드

블라인드 비교 · Elo 기반 모델 랭킹

자동 평가

심판 LLM 자동 채점 — 켜기·결과·통계·내보내기

추적

낮은 평가 점수의 원인을 트레이스에서 추적