한입AI사전 › 파라미터

파라미터 뜻, AI 모델이 크다는 건? 클로드 하이쿠 소넷 오푸스 차이

파라미터란 · 매개변수 · AI 파라미터 수 · 모델 크기 · 작은 모델 · 큰 모델 · 하이쿠 소넷 오푸스 · Haiku Sonnet Opus · 7B · 14B

파라미터(parameter, 매개변수)는 AI 모델 안에 들어 있는 숫자들로, 모델이 글을 읽으며 다음 말을 맞히는 연습을 할 때 조금씩 고쳐서 맞춰 둔 값입니다. 모델이 '크다' · '작다'는 건 이 숫자가 많다 · 적다는 뜻이고, 0.6B · 14B처럼 이름에 붙은 B는 10억(billion) 개를 뜻합니다.

클로드 하이쿠 소넷 오푸스 차이, 작은 모델과 큰 모델 | 파라미터 뜻
영상: 클로드 하이쿠 소넷 오푸스 차이, 작은 모델과 큰 모델 | 파라미터 뜻 (2:04)
영상 구간
  1. 0:00하이쿠 · 소넷 · 오푸스, 작은 모델과 큰 모델
  2. 0:31모델 안의 숫자, 파라미터
  3. 0:470.6B, 14B 읽는 법
  4. 1:05같은 질문, 정답률 비교
  5. 1:25큰 모델이 느린 이유
  6. 1:39언제 어떤 모델을 쓸까

하이쿠 · 소넷 · 오푸스, 무엇이 다를까

Claude에서 모델을 고르면 Haiku, Sonnet, Opus 같은 선택지가 나옵니다. Anthropic은 Claude Haiku 5.5를 내면서 "지금까지 낸 것 중 가장 싸고 가장 빠른 작은 모델"이라고 소개했고, Sonnet과 Opus는 "더 큰 모델"이라고 불렀습니다. 공식 비교표에서도 Haiku는 속도가 "가장 빠름", 입력 100만 토큰당 요금이 $0.10부터이고, Opus는 "보통", $4입니다.

ChatGPT도 같습니다. OpenAI는 GPT-5.6 시스템 카드에서 Terra와 Luna를 "더 작은 모델"이라고 적었습니다. Google도 Gemini 2.5 기술 보고서에서 Flash와 그 아래 모델을 "더 작은 모델"로 묶었습니다.

그렇다면 AI 모델이 작다, 크다는 건 무엇이 작고 크다는 걸까요?

크다는 건 파라미터가 많다는 뜻

AI 모델은 글을 읽으며 다음 말을 맞히는 연습을 하고, 틀릴 때마다 안에 있는 숫자들을 조금씩 고칩니다(LLM 참고). 이 숫자들이 파라미터입니다. 연습해서 배운 것은 모두 이 숫자들에 담깁니다.

모델이 크다는 건 이 숫자가 많다는 뜻입니다. 숫자가 많을수록 배운 것을 더 많이 담을 수 있습니다.

0.6B, 14B 읽는 법

Claude, ChatGPT, Gemini는 파라미터 수를 공개하지 않습니다. 대신 크기를 공개한 모델들이 있습니다. 공개 모델 이름 끝의 B는 10억(billion)이라는 뜻입니다.

모델파라미터 수파일 크기
Qwen3-0.6B-Base596,049,920개 (약 6억)1.2GB
Qwen3-4B-Base4,022,468,096개 (약 40억)8.0GB
Qwen3-14B-Base14,768,307,200개 (약 148억)29.5GB

이 세 모델은 모두 같은 글(토큰 36조 개)로 학습했습니다. 다른 것은 파라미터 수뿐이라서, 크기만 바꿔 비교할 수 있습니다.

같은 질문, 정답률 비교

세 모델에 "물은 섭씨 100도에서"를 넣고 다음 말이 "끓는다"일 확률을 봤습니다. 답이 하나로 정해지는 문장 10개(일본의 수도, 한글을 만든 왕, 태양계에서 가장 큰 행성 등)도 풀게 했습니다.

모델"끓는다" 확률문제 10개 중 맞힌 수
0.6B (약 6억 개)3%0개
4B (약 40억 개)39%5개
14B (약 148억 개)97%9개

파라미터가 많을수록 더 잘 맞힙니다. OpenAI도 시스템 카드에 "큰 모델이 작은 모델보다 사실을 더 정확히 말하는 경향이 있다"고 적었습니다. 가장 큰 모델도 하나는 틀렸습니다. "대한민국의 국화는" 다음에 "국화이다."라고 썼습니다(정답은 무궁화).

큰 모델이 느린 이유

대신 큰 모델은 무겁습니다. 토큰 하나를 만들 때마다 이 숫자들을 전부 써서 계산해야 하기 때문입니다. 같은 컴퓨터에서 같은 길이의 글을 쓰게 하면 0.6B는 초당 36토큰, 14B는 초당 23토큰으로 작은 모델이 약 1.6배 빨랐고, 파일 크기는 25배 가까이 차이 났습니다.

이 비교는 같은 방식으로 만든 형제 모델끼리의 결과입니다. 큰 상용 모델 중에는 토큰마다 파라미터 일부만 골라 쓰는 방식(mixture-of-experts)도 있어서, 파라미터 수와 속도가 항상 그대로 비례하지는 않습니다.

언제 어떤 모델을 쓸까

회사들이 파라미터 수를 밝히지는 않지만, 작은 모델을 더 빠르고 싼 모델로 소개합니다. 요약이나 분류처럼 쉬운 일은 작은 모델(Haiku, Luna, Flash)로 충분하고, 복잡한 일은 큰 모델(Sonnet, Opus)에 맡기면 됩니다. 모델이 한 번에 읽을 수 있는 글의 양은 크기와 별개인 컨텍스트 윈도우로 정해집니다.

출처와 실험 환경

  • 실험: Qwen3 공개 모델 세 개 (Qwen3-0.6B-Base · Qwen3-4B-Base · Qwen3-14B-Base). Hugging Face Jobs의 NVIDIA L40S GPU에서 transformers(bf16)로 실행, 2026년 10월 11일. 매번 1등 토큰만 고르는 방식(greedy)이고, Base 모델이 질문으로 이어 쓰지 않도록 모든 문장 앞에 "프랑스의 수도는 파리이다."를 붙였습니다. 속도는 새 토큰 64개를 만드는 시간(3번 잰 중앙값)입니다
  • "the cheapest, fastest, and most capable small model we've ever released": Anthropic, Introducing Claude Haiku 5.5 (2026-10-07) www.anthropic.com/claude-haiku-5-5
  • Claude 모델별 속도 · 요금: Anthropic, Models overview platform.claude.com/docs/en/about-claude/models/overview
  • "the smaller Terra and Luna models": OpenAI, GPT-5.6 System Card (2026-07-09) 11쪽 deploymentsafety.openai.com/gpt-5-6/gpt-5-6.pdf
  • "The smaller models in the Gemini 2.5 series — Flash size and below": Google, Gemini 2.5 Technical Report 2.1절 arxiv.org/abs/2507.06261
  • 모든 Qwen3 모델은 36조 토큰으로 학습: Qwen Team, Qwen3 Technical Report (2025) 3.1절 arxiv.org/abs/2505.09388