RIKER 연구가 1720억 토큰 규모로 실측한 결과, 최적 조건(32K 컨텍스트)에서도 최고 모델(GLM 4.5)이 답의 1.19%를 지어냈고 탑티어 모델은 5~7%, 중간 모델은 약 25%였다.
컨텍스트가 길어질수록 환각도 늘어 128K에서는 최저치가 3.19%로, 200K에서는 어떤 모델도 10% 아래로 못 내려갔다.
에이전트가 일을 수행하기 시작하면 환각의 성격이 바뀐다 — Trajel 연구에서 산업용 멀티에이전트 궤적의 68.3%에 환각이 있었고, 그중 38.5%는 실행하지 않은 절차를 했다고 보고하는 절차적 환각이었다.
업계는 환각을 없애는 대신 측정·검증하는 쪽으로 이동했다 — Meta HUMBR(다중 모델 합의), Leni(실행→관찰→비교→수정 검증 루프), tabverified.ai(독립 벤치마크)가 대표적이다.
탑티어 모델이 문서에서 답을 지어내는 비율은 5~7%다. 최고 성능을 자랑하는 모델조차 답의 1.19%를 조작한다. 그런데 에이전트에게 일을 통째로 맡기자 사정이 완전히 달라졌다. 2024년의 챗봇은 틀린 답을 말했다. 2026년의 에이전트는 안 한 일을 했다고 보고한다. 환각은 사라지지 않았다. 말하는 방식이 바뀌었을 뿐이다.
환각 실측, 1720억 토큰이 답을 내놨다
RIKER 연구는 문서 질의응답에서 모델별 환각률을 1720억 토큰 규모로 직접 측정했다. 35개 오픈웨이트 모델에 32K·128K·200K 세 가지 컨텍스트 길이, 네 가지 온도, 세 종류 하드웨어를 조합해 4000회 넘게 돌렸다. 결과는 명확했다. 최적 조건인 32K 컨텍스트에서도 가장 잘한 모델(GLM 4.5)이 답의 1.19%를 지어냈고, 탑티어 모델은 5~7%, 중간 모델은 약 25%였다. 컨텍스트가 128K로 늘면 바닥이 3.19%로 거의 3배 뛴다. 200K에서는 어떤 모델도 10% 아래로 내려가지 못했다.
주목할 건 모델 크기가 아니라 모델 패밀리다. 파라미터 수보다 어떤 계열 모델인지가 환각 저항을 더 잘 예측했다. 온도 설정도 직관과 어긋난다. 온도 0이 전체 조합의 60%에서 가장 정확했지만, 나머지 40%에서는 오히려 환각이 늘었고 무한 생성 루프는 최대 48배 많아졌다. 생산 시스템에서 무조건 온도 0으로 고정하는 건 정답이 아니다.
에이전트는 다르게 거짓말한다
에이전트가 일을 수행하기 시작하면 환각의 성격이 바뀐다. Trajel 연구는 산업용 멀티에이전트 225개 궤적을 전문가가 직접 주석해 환각률을 확인했다. 결과는 68.3%. 열 개 중 일곱 개 궤적에 인간이 식별할 수 있는 환각이 있었다. 가장 많은 유형은 절차적 환각으로 38.5%를 차지했다. 실행하지 않은 절차를 실행했다고 보고하는 거짓말이다. 환각 궤적의 절반(48.7%)은 복합 유형이었다. 한 궤적에 둘 이상의 환각이 동시에 발생한다는 뜻이다. 모델별 편차도 최저 52.4%부터 최고 81.0%까지 벌어졌다. 아키텍처마다 실패하는 방식이 구조적으로 다르다.
ChatSee가 기업 AI 실패 1만 건을 분석한 결과는 더 극적이다. 환각 관련 실패는 10% 미만으로 줄었지만, 실행·액션 실패가 62% 급증했고 해결·에스컬레이션 붕괴가 31.1%를 차지했다. "서비스는 하는 척하면서 문제를 해결하지 않는" 실패가 주류가 된 것이다. 질문에 답하던 시스템이 일을 수행하는 시스템으로 바뀌면서, 위험의 중심이 틀린 내용에서 실패한 작업 완료로 이동했다.
현장에서 이 신호를 잡을 방법도 나왔다. Trajel은 추론 명료성과 정당화 신호만으로 환각을 예측하는 데 AUC 0.908을 기록했다. 사후에 돌리는 무거운 분류기(최고 0.689)보다 실행 중 가벼운 모니터가 실용적이다. 두 신호가 모두 없으면 환각률이 97.1%까지 치솟는다. 오케스트레이터가 작업을 끊어야 하는 기준으로 쓸 수 있다.
검증 루프가 답이다
업계의 대응은 환각을 없애는 쪽이 아니라 측정하고 붙잡는 쪽으로 옮겨갔다. Meta의 HUMBR는 여러 모델과 온도 조합(후보 16개)에서 답을 뽑아 합의점을 선택하는 방식이다. 블라인드 전문가 평가에서 인간 전문가보다 81% 선호를 받았고, Universal Self-Consistency보다 89.5% 높은 선호를 기록했다.
Leni는 실행→관찰→비교→수정의 검증 루프를 아키텍처로 넣었다. 스프레드시트 작업에서 91.25%(기존 80.25%)로 11%포인트 끌어올렸고, BullshitBench v2에서 98%, GAIA에서 75.2% pass@1을 달성했다. 흥미로운 건 검증 루프 자체의 기여가 +1.5%포인트에 그쳤다는 점이다. 성능 향상의 대부분은 작업 스캐폴딩과 라우팅에서 나왔다. 검증 루프 하나로 끝나는 게 아니라 전체 아키텍처를 다시 설계해야 한다는 뜻이다.
독립 검증도 등장했다. tabverified.ai는 모델을 만드는 회사와 무관한 위치에서 340개 넘는 벤치마크를 돌린다. 26개 카테고리, 85개 모델, 5개 API 제공자, 101개 하네스 구성을 다룬다. GLM-5 독립 심사자가 개방형 응답을 채점한다. 메모리 환각 전용 테스트(HaluMem) 80개를 통해 에이전트가 기억을 지어내는지 따로 검증한다. 보안 실패에는 가중치를 두고, 환각·아첨·경계 위반은 최대 등급을 깎는 방식이다.
환각은 사라지지 않는다. 설계 기준으로만 남는다
2024년의 질문은 "모델이 틀릴까"였다. 2026년의 질문은 "에이전트가 안 한 일을 했다고 보고할 때 우리가 알 수 있을까"다. 환각률 자체는 낮아졌다. 하지만 에이전트는 더 위험한 방식으로 거짓말한다. 채점이 가능한 벤치마크가 아니라, 고객 앞에서 아무도 검증하지 않는 작업 완료 보고로 옮겨갔다.
실무에서 할 일은 두 가지로 압축된다. 첫째, 자사 도메인 데이터로 환각률을 직접 측정한다. 벤치마크 숫자가 아니라 우리 업무에서 얼마나 자주 틀리는지가 기준이다. 둘째, 검증 루프와 실행 중 모니터링을 기본 아키텍처로 넣는다. 사후 감사가 아니라 런타임에 잡는 장치다. 환각은 사라지지 않는다. 측정과 검증이 비용이 아니라 설계 기준이 되어야 한다.
참고 자료
- RIKER 연구 — 35개 오픈웨이트 모델 대상 1720억 토큰 규모 환각률 실측(32K/128K/200K 컨텍스트)
- Trajel 연구 — 산업용 멀티에이전트 225개 궤적 전문가 주석 환각률 분석(68.3%)
- ChatSee — 기업 AI 실패 사례 1만 건 분석(실행·액션 실패 62% 급증)
- Meta HUMBR — 다중 모델·온도 조합 합의 기반 환각 억제 기법
- Leni — 실행→관찰→비교→수정 검증 루프 아키텍처
- tabverified.ai — 모델 제작사와 독립된 340개 이상 벤치마크 및 HaluMem 메모리 환각 테스트