전문가 혼합 — 자기 일부만 돌리는 큰 모델
MoE 모델은 각 토큰을 여러 전문가 하위망 중 몇 개로 라우팅하여, 총 파라미터는 거대하되 토큰당 계산은 소박하게 유지합니다 — 여러 프런티어 모델 뒤의 아키텍처입니다.
아직 만들지 않았습니다
이 페이지는 카드에 적힌 내용을 펼쳐 보여줄 뿐입니다 — 돌아가는 코드도, 열어볼 데모도 아직 없습니다. 무엇을 왜 만들려는지가 아래에 있습니다.
어떻게 보나
아직 범위 미정.
기술 노트
각 항목이 실제로 무엇을 보여주고 어떻게 동작하는지 — 위 카드보다 자세한 기술 설명입니다.
전문가 혼합 — 자기 일부만 돌리는 큰 모델준비 중
목적: 이 PoC는 라우팅 메커니즘과 용량 대 계산 트레이드오프를 연구하여, 모델이 어떻게 '크면서' '돌리기 싸게' 될 수 있는지 설명합니다.
동작 방식: 아직 만들지 않음.