멀티모달 — 이미지와 텍스트를 함께 읽는 한 모델
비전-언어 모델은 픽셀과 토큰을 같은 컨텍스트에 받아 스크린샷 이해와 문서 파싱을 가능하게 하며 — 텍스트만이 아니라 이미지를 통한 프롬프트 인젝션 위험도 물려받습니다.
아직 만들지 않았습니다
이 페이지는 카드에 적힌 내용을 펼쳐 보여줄 뿐입니다 — 돌아가는 코드도, 열어볼 데모도 아직 없습니다. 무엇을 왜 만들려는지가 아래에 있습니다.
어떻게 보나
아직 범위 미정.
기술 노트
각 항목이 실제로 무엇을 보여주고 어떻게 동작하는지 — 위 카드보다 자세한 기술 설명입니다.
멀티모달 — 이미지와 텍스트를 함께 읽는 한 모델준비 중
목적: 이 PoC는 스크린샷 과제에서 VLM을 돌려 능력과 이미지로 실린 인젝션을 함께 보이며, 멀티모달의 힘을 그 새 공격 표면으로 연결합니다.
동작 방식: 아직 만들지 않음.