한입AI사전 › 토큰
토큰이란? AI가 글을 읽는 단위와 한국어 프롬프트
token · 토큰 뜻 · 토크나이저 · 토큰 사전
토큰은 AI 언어 모델이 글을 읽고 쓰는 단위입니다. 단어 하나가 토큰 하나일 때도 있고, 단어 일부나 글자 일부가 토큰 하나일 때도 있습니다. AI 요금과 한 번에 넣을 수 있는 양(컨텍스트 윈도우)이 모두 토큰 수로 정해집니다.

영상 구간
AI는 글자가 아니라 토큰을 읽는다
AI 언어 모델은 문장을 글자 그대로 받지 않습니다. 먼저 토큰 사전(토크나이저)을 써서 글을 조각으로 자르고, 조각마다 붙은 번호를 읽습니다. 사전에는 글에서 자주 나오는 덩어리가 들어 있습니다. 영어라면 "the", " hello" 같은 단어가 통째로 토큰 하나입니다.
사전에 없는 글자는 더 잘게 쪼갭니다. 컴퓨터 안에서 한글 한 글자는 숫자 세 개(UTF-8 3바이트, 예: "안" = EC 95 88)로 저장되는데, 사전에 그 글자가 없으면 이 숫자 하나하나를 토큰으로 읽습니다. 그래서 한글 한 글자가 토큰 세 개가 되기도 합니다.
토큰 수가 중요한 이유
- 요금: AI API 요금은 넣고 받은 토큰 수로 매겨집니다.
- 한 번에 넣을 수 있는 양: 컨텍스트 윈도우도 글자 수가 아니라 토큰 수로 정해집니다.
- 속도: 답은 LLM이 토큰을 하나씩 만들어 내는 방식이라, 토큰이 많을수록 오래 걸립니다.
예전에 한국어가 불리했던 이유
GPT-3의 토큰 사전은 거의 영어 글로 만들어져서 50,257개 조각 가운데 한글이 든 조각이 하나도 없었습니다. "입니다" 한 단어가 토큰 7개로 쪼개졌습니다. 같은 뜻의 문장이 한국어는 105토큰, 영어는 27토큰이었습니다. 한국어로 쓰면 요금이 네 배 가까이 나온 셈입니다.
AI가 공부한 글도 대부분 영어였습니다. 2023년에 나온 GPT-4는 같은 시험(MMLU)을 영어로 풀면 85.5%, 한국어로 풀면 77.0%를 맞혔습니다. "프롬프트는 영어로 써야 잘한다"는 말은 이 시절에는 근거가 있었습니다.
지금은 거의 같아졌다
토큰 사전이 커지면서 한글 조각이 들어갔습니다. GPT-4 사전에는 한글 조각이 281개, GPT-4o 이후 사전에는 2,352개 있습니다. "입니다"는 이제 통째로 토큰 하나입니다.
| 같은 문장 | GPT-3 사전 | GPT-4 사전 | GPT-4o 이후 사전 |
|---|---|---|---|
| 한국어 | 105토큰 | 45토큰 | 27토큰 |
| 영어 | 27토큰 | 27토큰 | 24토큰 |
답의 품질도 직접 비교했습니다. 지금의 ChatGPT(GPT-6 · Instant)에게 같은 시험 40문제를 한국어로 한 번, 영어로 한 번 풀게 했더니 영어 37문제, 한국어 35문제를 맞혔습니다. 영어로만 맞힌 3문제 가운데 2문제는 한국어판 번역이 틀린 문제였습니다. 그림 요청도 같은 내용을 두 언어로 각각 두 번씩 부탁했는데, 고양이 수 · 우산 색 · 자전거 위치 · 한글 간판까지 네 번 모두 맞게 그렸습니다.
아직 남은 예외
- 영상 · 이미지 생성 AI: 구글의 영상 AI Veo는 공식 문서에 영어만 평가했다고 밝혀 두었습니다. 이런 모델은 영어로 쓰는 편이 안전합니다.
- 작은 모델: Anthropic이 공개한 자료(2025년 모델 기준)에서 영어를 100으로 볼 때 한국어는 큰 모델이 약 97, 작은 모델이 약 93이었습니다. 모델이 작을수록 언어 차이가 조금 더 남습니다.
그래서 프롬프트는 어떤 언어로?
ChatGPT처럼 글로 대화하는 AI는 이제 한국어로 써도 거의 차이가 없습니다. 내가 가장 정확하게 설명할 수 있는 언어가 가장 좋은 프롬프트입니다. 영상이나 이미지를 만드는 AI는 모델마다 다르니, 영어만 확인했다고 밝힌 모델에는 영어로 쓰는 편이 안전합니다.
출처와 실험 환경
- 토큰 수: OpenAI tiktoken 0.14.0으로 직접 측정 (GPT-3 r50k_base · GPT-4 cl100k_base · GPT-4o 이후 o200k_base). 예문은 OpenAI "Hello GPT-4o" 발표의 한국어 문장과 같은 뜻의 영어 문장 openai.com/index/hello-gpt-4o/
- GPT-4 언어별 MMLU 정답률 (영어 85.5%, 한국어 77.0%): GPT-4 Technical Report (2023) Figure 5 arxiv.org/abs/2303.08774
- 시험 데이터: OpenAI simple-evals 다국어 MMLU (영어 원문과 전문 번역 한국어판에서 같은 40문제) github.com/openai/simple-evals
- 영상 AI 언어 지원: Google Gemini API Veo 3.1 문서, 제한사항 ai.google.dev/gemini-api/docs/veo?hl=ko
- 언어별 성능 (Claude Sonnet 4.5 · Haiku 4.5, 2025년 모델): Anthropic, Multilingual support platform.claude.com/docs/en/build-with-claude/multilingual-support
- 시험과 그림 비교: ChatGPT 웹, GPT-6 · Instant, 2026년 10월 9일 직접 실험
