응답 품질 분석
LLM이 생성한 응답의 품질과 안전성을 자동 평가하여, 할루시네이션·유해성·PII 유출·프롬프트 인젝션·사실성·답변 적절성 등의 위험을 카테고리별로 모니터링하는 메뉴입니다. 호출량·비용·지연 같은 운영 지표만으로는 드러나지 않는 "응답 내용 자체가 믿을 만하고 안전한가"를 진단하는 데 활용합니다.
평가는 정규식·NLI·LLM Judge 등 여러 평가기를 조합한 하이브리드 방식으로 수행되며, 비용 통제를 위해 전체 호출 중 일부를 샘플링하여 평가합니다. 각 평가 항목은 점수로 산출되고, 위젯의 위반 기준(임계값) 을 기준으로 위반 여부가 집계됩니다.
화면은 위에서 아래로 요약 → 위반 추이·히트맵 → 점수 분포·모델 비교 → 시간대 히트맵 → 위반 케이스 순서로 구성되어, 전체 현황 파악부터 개별 위반 사례 확인까지 따라갈 수 있습니다. 상단 옵션바에서 시간 범위와 필터를 설정한 뒤 위젯 데이터를 조회합니다.

요약 카드
선택한 시간 범위의 핵심 품질 지표를 한눈에 보여주는 카드입니다.
평가율
전체 LLM 호출 중 품질 평가가 수행된 호출의 비율을 표시합니다. 카드 하단에는 평가 LLM 호출 수와 전체 호출 수가 함께 표시됩니다. (예: 평가 LLM 호출 170 / 134.8K)
- 평가는 비용이 발생하므로 샘플링 비율 내에서 운영됩니다. 평가율이 낮으면 표본이 작아 다른 위젯의 비율 해석에 주의가 필요합니다.
응답 품질
평가된 응답의 종합 품질 점수를 표시합니다.
- 여러 평가 항목을 종합한 대표 지표로, 추세가 하락하면 품질 저하 신호로 해석하세요.
할루시네이션 의심율
할루시네이션 점수가 기준 이상인 호출의 비율을 표시합니다. 카드 하단에는 판정 기준과 해당 호출 수가 함께 표시됩니다. (예: score ≥ 0.5 11.4K)
- RAG·검색 기반 응답에서 사실과 다른 내용이 생성되는 정도를 나타냅니다. 비율이 상승하면 컨텍스트 구성이나 모델을 점검하세요.