평가 — 측정하지 않는 것은 개선할 수 없다, 심판까지 포함해
LLM 평가는 정확 일치 벤치마크부터 모델을 심판으로 쓰는 것까지 걸쳐 있으며, 심판 자체에 편향(길이, 위치, 자기 선호)이 있어 그 점수를 믿기 전에 측정해야 합니다.
아직 만들지 않았습니다
이 페이지는 카드에 적힌 내용을 펼쳐 보여줄 뿐입니다 — 돌아가는 코드도, 열어볼 데모도 아직 없습니다. 무엇을 왜 만들려는지가 아래에 있습니다.
어떻게 보나
아직 범위 미정.
기술 노트
각 항목이 실제로 무엇을 보여주고 어떻게 동작하는지 — 위 카드보다 자세한 기술 설명입니다.
평가 — 측정하지 않는 것은 개선할 수 없다, 심판까지 포함해준비 중
목적: 이 PoC는 작은 평가 집합과 LLM 심판을 만든 뒤 심판 자신의 편향을 측정합니다 — 점수판을 정직하게 유지하는 메타 평가입니다.
동작 방식: 아직 만들지 않음.