OpenAI는 세레브라스 칩으로 표준 대비 최대 14배 빠른 응답(초당 750토큰)을 내는 Ultrafast 모드를 GPT-5.6 Sol에 얹었다.
구글은 전작 대비 가격을 절반(100만 토큰당 0.75달러)으로 내린 Gemini 3.7 Flash를 출시 3주 만에 내놨다.
Anthropic은 Claude Code 자동 실행 모드를 기본값으로 바꾸고 EU AI법 대응 텍스트 워터마킹을 공개했으며, xAI는 자체 클라우드 컴퓨터에서 병렬로 상시 가동하는 Grok Bot을 내놨다.
메타는 300억 파라미터 로컬 모델 Muse Glimmer를 Apache 2.0 라이선스로 공개해 24~32GB 메모리의 맥·PC에서도 상시 로컬 에이전트를 돌릴 수 있게 했다.
초당 750개 토큰을 쏟아내는 모델, 가격을 절반으로 내린 모델, 노트북 한 대에서 도는 모델. 지난주 세계 5대 AI 모델 업체가 한꺼번에, 그러나 서로 정반대 방향으로 달렸다. OpenAI는 속도로, 구글은 가격으로, 메타는 거리로, 앤트로픽과 xAI는 자율성으로 승부를 걸었다.
속도 14배와 가격 절반, OpenAI와 구글의 정면 승부
OpenAI는 8월 13일 GPT-5.6 Sol에 Ultrafast 모드를 얹었다. 세레브라스(Cerebras) 칩을 써서 표준 대비 최대 14배 빠른 응답, 초당 최대 750개 토큰을 내놓는다. 실시간 장애 대응, 고객 응대, 금융 시장 분석처럼 지연이 곧 손실로 이어지는 업무를 겨냥한 것이다(OpenAI 블로그, TechCrunch).
구글은 같은 날 Gemini 3.7 Flash를 내놨다. 3.6 Flash가 나온 지 3주 만이다. 입력 100만 토큰당 0.75달러로, 전작의 절반(50% 인하) 가격이다. 개인용 에이전트인 Gemini Spark도 이 모델로 갈아탔다(Google 블로그, Bloomberg).
실무 의미는 분명하다. 속도가 14배 빨라지고 토큰 단가가 절반으로 떨어지면, 에이전트를 수백 개 돌리는 기업의 운영비가 그만큼 내려간다. 국내 반향도 크다. API 단가 인하가 이어지면 한국 스타트업과 중소 SaaS의 AI 진입 장벽이 낮아진다.
에이전트를 동료로 만든 주, 앤트로픽과 xAI
Anthropic은 Claude Code의 자동 실행 모드를 기본값으로 바꾸고, 크롬 사이드 패널의 '클로드 인 크롬'을 '클로드 카우워크(Claude Cowork)'로 확장했다. 브라우저에서 시작한 작업을 데스크톱·모바일로 이어서 끝까지 수행한다. 유럽 AI법(8월 2일 시행)에 대응한 텍스트 워터마킹도 공개했다(Claude 블로그, Anthropic 뉴스).
xAI는 8월 12일 Grok 4.6을 내고, 이틀 뒤 깃허브의 AI 코딩 도구에서 쓸 수 있게 했다. 가격은 입력 100만 토큰당 2달러다. 같은 날 공개한 Grok Bot은 자체 클라우드 컴퓨터를 갖고 병렬로 일하는 상시 가동 에이전트로, 봇끼리 메시지를 주고받으며 일을 넘긴다(xAI 뉴스, The Verge).
실무 의미는 크다. 채팅 도구를 넘어 '동료처럼 일하는 AI'가 제품으로 나오는 국면이다. 국내 기업은 데모를 넘어, 어떤 업무를 에이전트에 넘길지와 그 책임 경계를 누가 질지 정해야 할 시점이다.
메타는 노트북에서 도는 모델을 꺼냈다
Meta는 8월 10일 Muse Glimmer를 공개했다. 300억 파라미터 모델인데, 24~32GB 그래픽 메모리를 가진 맥이나 PC 한 대에서 항상 켜진 로컬 에이전트로 돌아가도록 설계됐다. 가중치는 Apache 2.0 라이선스로 풀렸고, 올라마·LM 스튜디오 같은 로컬 실행 도구와 vLLM 서빙 프레임워크를 모두 지원한다. 마크 저커버그 CEO는 같은 날 6,000단어 에세이로 '개인 초지능' 비전을 밝혔다(Meta AI Research 블로그, CNBC).
실무 의미는 데이터 경계에 있다. API로 보낼 수 없는 금융·의료·제조 데이터를 다루는 기업에는 로컬 에이전트가 대안이 된다. 국내 반향도 직접적이다. 망분리와 내부망 규제를 받는 한국 기업 환경에서, 오픈 가중치 로컬 모델은 온프레미스 AI 도입의 현실적 선택지가 된다.
모델은 선택지가 아니라 기준이다
더 빠르게(OpenAI), 더 싸게(구글), 더 가깝게(메타), 더 자율적으로(앤트로픽·xAI). 서로 다른 방향으로 보이지만 공통점은 하나다. 에이전트를 돌리는 비용과 책임을 낮추는 것.
그래서 기업이 물어야 할 질문은 '어떤 모델이 제일 뛰어난가'가 아니다. 내 업무에서 측정 가능한 비용 절감이 무엇인지부터 정하는 것이다. 모델은 선택지가 아니라, 그 기준에 맞춰 고르는 도구다. 일주일마다 바뀌는 속도·가격·개방성 경쟁을 좇기보다, 자기 데이터와 업무에 맞는 한 가지를 정해 검증하는 편이 낫다.
참고 자료
- OpenAI 블로그 — GPT-5.6 Sol Ultrafast 모드 발표
- Google 블로그 — Gemini 3.7 Flash 출시
- Claude 블로그 — Claude Code 자동 실행 모드 기본화
- xAI 뉴스 — Grok 4.6 및 Grok Bot 출시
- Meta AI Research 블로그 — Muse Glimmer 공개