헌법적 AI — 평가자만이 아니라 적힌 원칙에서 오는 정렬
헌법적 AI는 모델이 적힌 원칙 집합에 대해 자기 출력을 비평·수정하게 하여 인간 라벨 의존을 줄이고 — 가치 판단을 감사 가능한 문서로 옮깁니다.
아직 만들지 않았습니다
이 페이지는 카드에 적힌 내용을 펼쳐 보여줄 뿐입니다 — 돌아가는 코드도, 열어볼 데모도 아직 없습니다. 무엇을 왜 만들려는지가 아래에 있습니다.
어떻게 보나
아직 범위 미정.
기술 노트
각 항목이 실제로 무엇을 보여주고 어떻게 동작하는지 — 위 카드보다 자세한 기술 설명입니다.
헌법적 AI — 평가자만이 아니라 적힌 원칙에서 오는 정렬준비 중
목적: 이 PoC는 자기 비평 루프와 원칙 집합이 행동을 결정하는 지점을 연구하여, 헌법을 모델 가치의 검토 가능한 자리로 규정합니다.
동작 방식: 아직 만들지 않음.