한입AI사전 › 할루시네이션

할루시네이션 뜻 (AI 환각), AI가 자꾸 거짓말하는 이유

AI 할루시네이션 · 할루시네이션 뜻 · AI 환각 · 환각 현상 · 할루시네이션이란 · 챗GPT 거짓말 · AI 거짓말 · 챗GPT 거짓말 못하게 · hallucination

할루시네이션(hallucination, 환각)은 AI가 모르는 것을 모른다고 하지 않고 그럴듯하게 지어내 사실처럼 말하는 현상입니다. 다음에 올 말을 확률로 골라 이어 쓰는 언어 모델은 확률이 여러 답에 흩어져 있어도 그중 하나를 골라 자신 있게 쓰기 때문에, 물을 때마다 다른 틀린 답이 나오기도 합니다.

AI가 자꾸 거짓말하는 이유 | AI 할루시네이션 뜻
영상: AI가 자꾸 거짓말하는 이유 | AI 할루시네이션 뜻 (2:24)
영상 구간
  1. 0:00물을 때마다 다른 답
  2. 0:22AI 할루시네이션 뜻, 모르면 찍는 이유
  3. 0:44확률이 흩어지면 지어낸다
  4. 1:07모른다고 하면 덜 틀릴까 (실험)
  5. 1:35줄이는 법, 검색, 직접 확인

같은 질문, 매번 다른 답

Gemini에 "2003년 한화 이글스 팀 도루 개수 몇 개였어?"라고 물으면 71개라고 답합니다. 새 채팅에서 똑같이 물으니 108개라고 했고, 챗GPT는 출처까지 붙여 56개라고 했습니다. KBO 기록실의 실제 기록은 78개입니다. 세 번 물었을 때 한 번은 78개로 맞히기도 했지만, 대부분은 그럴듯한 다른 숫자였습니다.

이처럼 AI가 모르는 것을 그럴듯하게 지어내 사실처럼 말하는 것을 할루시네이션(AI 할루시네이션), 우리말로 환각이라고 합니다.

왜 모른다고 하지 않고 지어낼까

객관식 시험에서 모르는 문제를 비워 두면 0점이지만, 찍으면 맞을 수도 있습니다. OpenAI 연구진은 AI도 이렇게 채점받아 왔기 때문에, 모를 때 "모른다"고 하기보다 찍는 쪽이 점수가 높았다고 설명합니다.

구조로 보면 이렇습니다. AI는 다음에 올 말을 확률로 고릅니다(LLM 참고). 공개 모델 Qwen3-14B에 "한글을 만든 왕은" 다음 말을 물으면 '세(종)'에 98%가 몰립니다. 그런데 "2003년 한화 이글스의 팀 도루 개수는 총" 다음 숫자는 1위인 100조차 1.7%이고, 실제 정답 78은 0.4%로 111위입니다. 확률이 여러 숫자에 흩어져 있어도 AI는 그중 하나를 골라 자신 있게 이어 쓰고, 그래서 물을 때마다 다른 숫자가 나옵니다.

OpenAI 논문에서도 저자의 생일을 "아는 경우에만 답하라"고 세 번 물었더니 03-07, 15-06, 01-01로 세 번 모두 다른 날짜가 나왔습니다. 실제 생일은 가을입니다.

모른다고 하면 덜 틀릴까

OpenAI가 공개한 SimpleQA 비교에서 o4-mini와 gpt-5-thinking-mini의 정답률은 24%와 22%로 비슷했지만, 틀린 답은 75%와 26%로 세 배 가까이 차이 났습니다. gpt-5-thinking-mini는 모를 때 모른다고 답했기 때문입니다.

직접 해 봤습니다. 야구 기록 10개를 Gemini에 물었습니다.

질문 방법맞힘틀림모른다
그냥 물음190
질문 끝에 "모르면 모른다고 해"343

모를 때 어떻게 할지 알려 주면 지어내는 답이 줄었습니다. Claude를 만든 Anthropic도 공식 문서에서 "Claude가 '모르겠다'고 말해도 된다고 허락하라"고 권합니다.

검색도 도움이 된다

OpenAI는 GPT-5가 검색을 잘 쓰도록 훈련했고, 검색을 켠 실제 ChatGPT 대화에서 큰 사실 오류가 있는 답이 이전 모델 o3의 22.0%에서 4.8%로 줄었다고 밝혔습니다. 2023년 초 챗GPT가 "세종대왕 맥북프로 던짐 사건"을 조선왕조실록에 기록된 일처럼 설명해 화제가 됐지만, 지금 다시 물으면 실제 역사에 없는 일이라고 바로 짚어 줍니다.

다만 작은 숫자처럼 딱 그 값이 적힌 글을 찾기 어려운 질문은 검색을 켜도 여전히 틀릴 수 있습니다. 위의 도루 개수가 그런 예입니다. 할루시네이션은 줄일 수는 있어도 0이 되지는 않으니, 숫자나 출처처럼 중요한 정보는 직접 확인하는 것이 좋습니다.

출처와 실험 환경