RLHF — 모델을 선호에, 그리고 그 편향에 정렬하기
인간 피드백 강화학습은 모델을 평가자가 선호하는 쪽으로 조정하며, 이는 원시 모델이 유용한 조수가 되는 방법이자 평가자 편향이 모델 행동이 되는 방법입니다.
아직 만들지 않았습니다
이 페이지는 카드에 적힌 내용을 펼쳐 보여줄 뿐입니다 — 돌아가는 코드도, 열어볼 데모도 아직 없습니다. 무엇을 왜 만들려는지가 아래에 있습니다.
어떻게 보나
아직 범위 미정.
기술 노트
각 항목이 실제로 무엇을 보여주고 어떻게 동작하는지 — 위 카드보다 자세한 기술 설명입니다.
RLHF — 모델을 선호에, 그리고 그 편향에 정렬하기준비 중
목적: 이 PoC는 보상모델+정책 루프를 개념적으로 연구하고 선호 데이터가 편향을 주입하는 지점을 봅니다 — 정렬을 데이터 출처 문제로 규정합니다.
동작 방식: 아직 만들지 않음.