한입AI사전 › LLM
LLM이란? 대규모 언어 모델과 다음 토큰 예측
Large Language Model · 대규모 언어 모델 · 거대언어모델 · 언어 모델 · 다음 토큰 예측
LLM(Large Language Model, 대규모 언어 모델)은 지금까지의 글을 보고 다음에 올 토큰 하나를 확률로 고르는 일을 반복해서 글을 만드는 AI 모델입니다. 아주 많은 글로 학습하고 파라미터가 아주 많아서 '대규모(Large)'라고 부릅니다. ChatGPT · Claude · Gemini가 모두 LLM입니다.

영상 구간
답이 한 글자씩 써지는 이유
ChatGPT에게 질문하면 답이 한 번에 뜨지 않고 조금씩 써집니다. 기다리는 사람을 위한 효과가 아닙니다. 모델도 다음에 쓸 말을 아직 모르기 때문입니다. LLM은 답 전체를 한 번에 만들지 않고, 다음에 올 토큰 하나를 고르고, 그걸 붙인 다음 다시 계산하기를 반복합니다.
휴대폰 키보드의 추천 단어와 비슷합니다. "오늘 저녁"까지 치면 "뭐"를 추천하고, "뭐"를 누르면 그다음 말을 또 추천합니다. LLM이 하는 일이 이것이고, 이를 다음 토큰 예측이라고 부릅니다.
실제 확률로 보기
공개 모델 Qwen3-4B-Base에 "대한민국의 수도는"까지 넣으면 다음 토큰 후보와 확률이 이렇게 나옵니다. (그대로 넣으면 모델이 "어디인가요?"라는 질문으로 이어 가서, 답을 말하는 문장이 되도록 "프랑스의 수도는 파리이고, "를 앞에 붙였습니다.)
- 1등 " 서울" 82.5%, 나머지 후보는 다 합쳐도 20%가 안 됩니다.
- " 서울"을 문장 뒤에 붙이고, 길어진 문장으로 처음부터 다시 계산합니다.
- 긴 답도 전부 이 반복입니다. 계산이 한 번 끝날 때마다 토큰이 하나씩 나옵니다.
대화도 마찬가지입니다. 모델 입장에서 대화는 "사용자: … 어시스턴트: …" 형식으로 이어 붙인 하나의 긴 글입니다. 질문 다음에 답이 오는 글을 아주 많이 배웠기 때문에, "어시스턴트:" 자리에서 고른 다음 토큰이 답의 첫 말이 됩니다.
확률은 어디서 나올까: 학습과 파라미터
모델은 미리 엄청난 양의 글을 읽으며 연습해 둡니다. 글을 읽다가 다음 토큰을 가리고 맞혀 보고, 틀리면 정답 쪽 확률이 올라가도록 모델을 조금 고칩니다. Qwen3 모델들은 이 연습을 토큰 36조 개 분량의 글로 반복했습니다.
여기서 "고친다"는 것은 모델 안에 있는 숫자들을 조금씩 바꾼다는 뜻입니다. 이 숫자들을 파라미터라고 부르고, 연습해서 배운 것은 전부 여기에 담깁니다. 실제로 Qwen3-0.6B-Base에 "해가 지고 하늘이 점점 어두워졌다" 한 문장으로 한 번 고쳐 보면, 정답 " 어"의 확률이 1.4%에서 23.6%로 오르고 파라미터 하나가 -0.0718에서 -0.0733으로 바뀝니다.
파라미터가 많으면 무엇이 다를까
똑같이 36조 토큰으로 학습했지만 파라미터 수만 다른 두 모델에 "물은 섭씨 100도에서"를 넣고 다음 말로 " 끓"이 나올 확률을 봤습니다.
| 모델 | 파라미터 수 | " 끓" 확률 |
|---|---|---|
| Qwen3-0.6B-Base | 596,049,920개 (약 6억) | 1.1% (10등) |
| Qwen3-14B-Base | 14,768,307,200개 (약 148억) | 80.7% (1등) |
파라미터가 많을수록 더 많은 것을 담을 수 있고, 다음 토큰을 더 잘 맞힙니다.
그래서 이름이 Large Language Model
다음 토큰을 맞히는 모델을 언어 모델이라고 합니다. 이를 아주 많은 글로, 아주 크게 만든 것이 Large Language Model, 줄여서 LLM입니다. ChatGPT도 같습니다. OpenAI는 GPT-4를 "문서의 다음 토큰을 예측하도록 사전 학습한 트랜스포머 모델"이라고 소개합니다.
정리하면, LLM은 지금까지의 글을 보고 다음 토큰 하나를 고르는 일을 아주 빠르게 반복하는 모델입니다. 한 번에 볼 수 있는 글의 양에는 한계가 있는데, 이것이 컨텍스트 윈도우입니다.
출처와 실험 환경
- 실험: Qwen3 공개 모델 (Qwen3-0.6B-Base · Qwen3-4B-Base · Qwen3-14B-Base, 대화 형식은 Qwen3-4B). Hugging Face Jobs의 NVIDIA L40S GPU에서 transformers로 실행, 2026년 10월 10일. 매번 1등 토큰만 고르는 방식(greedy)이라 다시 돌려도 같은 값이 나옵니다
- 학습 데이터 36조 토큰: Qwen Team, Qwen3 Technical Report (2025) 3.1절 arxiv.org/abs/2505.09388
- "GPT-4 is a Transformer-based model pre-trained to predict the next token in a document.": OpenAI, GPT-4 Technical Report (2023) 요약 arxiv.org/abs/2303.08774
