토크나이제이션 — 모델은 문자를 보지 않는다
텍스트는 모델이 보기 전에 서브워드 토큰으로 쪼개지며, 그래서 모델이 글자를 잘못 세고, 어떤 언어는 토큰이 더 들고, 프롬프트의 실제 길이가 문자 수가 아닙니다.
아직 만들지 않았습니다
이 페이지는 카드에 적힌 내용을 펼쳐 보여줄 뿐입니다 — 돌아가는 코드도, 열어볼 데모도 아직 없습니다. 무엇을 왜 만들려는지가 아래에 있습니다.
어떻게 보나
아직 범위 미정.
기술 노트
각 항목이 실제로 무엇을 보여주고 어떻게 동작하는지 — 위 카드보다 자세한 기술 설명입니다.
토크나이제이션 — 모델은 문자를 보지 않는다준비 중
목적: 이 PoC는 같은 토크나이저로 영어와 한국어를 토큰화해 비용 비대칭과 세기 실패를 보이며, 보이지 않는 전처리를 드러냅니다.
동작 방식: 아직 만들지 않음.