LLM Visualization (언어 모델 3D 해부)

GPT 언어 모델의 내부를 3차원 그림으로 펼쳐 놓고 위에서 아래로 따라 내려가는 해설입니다. 파라미터가 8만 5천 개뿐인 nano-gpt로 시작해, 'C B A B B C' 같은 글자열을 알파벳 순으로 정렬하는 아주 단순한 과제를 모델이 어떻게 처리하는지 봅니다. 숫자가 임베딩이 되어 여러 층을 지나 다음 토큰 확률로 나오기까지, 층마다 어떤 계산이 일어나는지 감을 잡을 수 있습니다.

LLM Visualization (언어 모델 3D 해부)

이렇게 해보세요

화면 아래의 'Continue'를 누르거나 스페이스바를 눌러 설명을 한 단계씩 진행하고, 3D 모형은 마우스로 돌리고 확대해 볼 수 있습니다. 왼쪽 목차에서 임베딩, 셀프 어텐션, 소프트맥스 같은 항목을 골라 원하는 부분만 볼 수도 있고, 위쪽에서 nano-gpt 대신 GPT-2나 GPT-3 규모를 골라 크기를 비교할 수 있습니다. 화면이 영어로만 제공됩니다.