상세 컨텐츠
챗GPT, 제미나이 등 AI 모델 환각률 by VISUALCAPITALIST.com
본문
제미나이 3, 챗GPT 5.1, 클로드 오푸스 4.5 등 생성AI들의 버전업이 계속되고 있습니다. 조금씩이든 많이 든 업데이트되면서 AI의 강력함을 보여주고 있는데요. 그렇게 AI들이 똑똑해지는 듯하면서도 그들이 내놓는 답을 온전히 믿을 수 없는 건 소위 AI 환각(AI Hallucination)을 일으키며 종종 이상한 얘기를 하기 때문입니다. 답변의 주요 내용이 대부분 거짓말일 때도 있지만, 대부분의 진실에 일부 거짓을 섞어 더 혼란에 빠트리는 경우가 종종 있는데요.
AI는 거짓말을 한다? 주요 AI 모델별 환각률 비교
어떤 AI 모델이 더 환각률이 높은지에 대해서 생각해 보신 적 있으세요? 2025년 3월 컬럼비아 저널리즘 리뷰(Columbia Journalism Review)의 테스트를 바탕으로 TERZO와 VISUAL CAPITALIST가 정리한 이 인포그래픽은 주요 AI 모델의 환각률이 어느 정도인지를 비교하고 있는데요. 몇 달 전 데이터이고 제한된 실험이니 절대적인 건 아니겠지만, 참고는 해보시죠.
AI Search Has a Citation Problem
We compared eight AI search engines. They’re all bad at citing news.
www.cjr.org

무엇을 질문하든 후두둑 답을 뱉어내는 AI의 답변 중 진실이 아닌 경우가 얼마나 될까요? 가장 심각한 것으로 알려진 건 Xai의 그록-3(Grok-3)였습니다. 환각률은 무려 94%, 그록-2(Grok-2)도 77%로 가장 환각률이 높은 AI 형제로 꼽혔습니다. 이어서 구글의 제미나이(Gemini)가 환각률 76%로 꽤 높았습니다.
가성비로 주목 받은 중국의 딥시크(Deepseek)의 환각률은 68%, 오픈AI의 챗GPT(ChatGPT)의 환각률은 67%, 퍼플렉시티 프로(Perplexity Pro)의 환각률은 45%, 마이크로소프트의 코파일럿(Copilot)의 환각률은 40%, 비교 대상 중 가장 낮은 퍼플렉시티(Perplexity)의 환각률은 37%였는데 흥미로운 건 프로 버전의 환각률이 더 높았다는 거였죠.
연구진은 각 모델에 뉴스에서 발췌한 내용을 주고 각 모델에게 원본 기사, URL 등을 식별하게 요청하고, 전통적인 구글 검색 결과와 비교하며 응답의 정확성을 판단했다고 하는데요. 생각보다 환각률이 높게 나와서 정말 저렇게 많이 틀릴까 싶을 정도이긴 한데. 점점 나아지고 있다는 해도 아직 환각에서 자유롭지 않은 게 AI들이니 AI가 내놓는 답을 맹신하거나 그것만 믿고 중요한 결정을 쉽게 내리는 실수는 하지 않으셨으면 좋겠습니다. AI 시대라고 해도 돌다리는 두들겨 보고 건너야 한다는 거 잊지 마세요.@_@/
Ranked: AI Hallucination Rates by Model
Key Takeaways Many of today’s AI models struggled when asked to identify and cite news sources from an excerpt, producing frequent errors. The highest over…
www.voronoiapp.com
댓글 영역