LLM, 당신에게 맞는 모델을 어떻게 찾을 것인가?
📋핵심 요약 NAACL 2025 "Are We Done with MMLU?" 논문에 따르면 Virology 문항의 57%에서 정답 오류가 발견됐고, 재검수판 MMLU-Redux로 측정하면 주요 모델 점수가 3~8%p 일제히 하락한다. Ollama·LM Studio·
Filed under
🔬
📋핵심 요약 NAACL 2025 "Are We Done with MMLU?" 논문에 따르면 Virology 문항의 57%에서 정답 오류가 발견됐고, 재검수판 MMLU-Redux로 측정하면 주요 모델 점수가 3~8%p 일제히 하락한다. Ollama·LM Studio·
📋핵심 요약 Claude Opus 4.7은 로봇 하드웨어 프로그래밍과 센서 통합을 10분 미만에 자율 완료해 가장 빠른 인간 팀보다 20배, 무보조 인간 팀보다 37배 빨랐지만, 공을 옮기는 정밀 물리 조작에서는 실패했다. AI 에이전트 경쟁에서
📋핵심 요약 2026년 3~4월 Claude Code 품질 저하는 추론 노력 기본값 하향·캐시 버그·출력 길이 제한이라는 세 가지 제품 버그가 겹친 결과였고, Anthropic은 4월 23일 공식 포스트모템에서 이를 인정했다. 2026년 6월 12일
📋핵심 요약 Anthropic Economic Index에 따르면 한국의 AI 활용 지수(AUI)는 3.12로 전 세계 116개국 중 7위이며, Claude 카드 사용액은 1년 만에 830% 급증했다. 한국에서 Claude는 마케팅 콘텐츠 제작(전체 사용량의 4.
📋핵심 요약 Claude는 API 직판·웹 무료·웹 유료(Pro/Max/Enterprise)·리셀러(AWS Bedrock 등) 네 가지 채널로 제공되며, 같은 모델이라도 채널마다 가격과 제약이 다르다. API는 수익의 80% 이상을 책임지는 핵심 채널이자 프롬프트·
📋핵심 요약 Claude.ai 웹은 월 $20(Pro) 고정 요금으로 Sonnet·Opus를 제한 없이 쓸 수 있는 완성형 채팅 서비스이며, 전 세계 Claude 사용량의 90%가 여기서 발생한다. Claude API는 토큰당 과금(Sonnet 4.