1.6조 개 매개변수. 토큰 하나 처리하는 데 실제로 일하는 건 490억 개뿐이다. 나머지 1조 5,510억 개는 그 순간 자고 있다. 딥시크 V4 논문을 열어보니, MoE가 단순한 아키텍처 선택이 아니었다. 벤치마크 점수가 아니라 토큰당 청구서를 결정하는 공식이었다.
딥시크 V4-Pro는 총 1.6조 매개변수 중 토큰당 실제 활성화되는 건 490억 개뿐이다(256개 전문가 중 일부만 호출하는 MoE 구조)
압축 스파스 어텐션(CSA)·고압축 어텐션(HCA)으로 1M 토큰 처리 시 V3.2 대비 FLOPs는 27%, KV 캐시는 10%만 필요하다
5월 31일 가격을 75% 인하해 영구화했다 — V4-Pro 입력은 1M 토큰당 0.435달러(GPT-5.5는 5달러), 캐시 히트 시 120분의 1까지 절감된다
다만 7월 정식 출시를 앞두고 피크 시간대 요금 2배 인상 계획도 함께 발표돼, 단가 안정성은 계속 지켜봐야 할 변수다
49B만 깨우는 구조, 1.6T를 품은 전략
V4-Pro의 총매개변수는 1.6조 개다. GPT-4를 한참 웃도는 숫자다. 그런데 토큰 하나를 처리할 때 실제로 켜지는 건 49B 개에 불과하다. 256개 전문가 중 필요한 일부만 호출하는 MoE 구조 덕분이다. 어느 전문가를 부를지 정하는 라우터가 매 토큰마다 선택하고, 이 선택이 곧 비용과 성능의 균형을 결정한다.
논문은 라우팅 안정성을 위해 첫 3개 레이어를 해시 라우팅으로 고정했다. 전문가 친화도 함수도 V3의 시그모이드에서 Sqrt(Softplus)로 바꿨다. 보조 손실 없이 시퀀스 내 불균형만 완화하는 방식도 유지했다. 모델 크기와 추론 비용을 구조적으로 분리한 것이다. 32T 토큰으로 학습한 거대 모델의 지식을 작은 활성화 비용으로 서빙한다.
기업 입장에서 파라미터 총량은 무의미하다. 토큰당 실제 연산량이 곧 청구서다.
어텐션 비용 10%로 — CSA와 HCA의 이중주
1M 토큰 컨텍스트에서 진짜 병목은 전문가가 아니라 어텐션이다. KV 캐시가 토큰마다 쌓이고 컨텍스트가 길어질수록 기하급수적으로 무거워진다. V4는 이 문제를 압축 스파스 어텐션(CSA)과 고압축 어텐션(HCA)으로 풀었다.
CSA는 KV 캐시를 4분의 1로 압축한 뒤 상위 1,024개 토큰만 집중 조회한다. HCA는 128분의 1로 압축한 캐시 전체를 밀집 조회한다. 두 방식을 레이어마다 번갈아 배치했다. 결과는 명확하다. 1M 토큰 처리에서 V3.2 대비 단일 토큰 추론 FLOPs는 27%, KV 캐시는 고작 10%만 필요하다.
연산 4분의 1, 메모리 10분의 1. 장문 계약서나 방대한 문서 분석을 비용 문제로 포기하던 이유가 사라졌다. mHC 잔차 연결과 Muon 옵티마이저는 이 깊은 구조의 학습 안정성을 뒷받침한다. 구조 혁신이 곧 가격표에 찍힌다.
캐시 히트 1,300분의 1, 75% 할인의 영구화
5월 31일, 딥시크는 V4-Pro 가격을 75% 깎은 채 영구 정책으로 확정했다. 현재 V4-Pro는 입력 1M 토큰당 0.435달러, 출력은 0.87달러다. 캐시 히트 입력은 0.003625달러. 같은 시점 GPT-5.5는 입력 5달러, 출력 30달러다.
출력 기준 약 34배 차이다. 캐시 히트를 적극 활용하면 입력 비용은 일반가의 120분의 1까지 내려간다. 반복 참조가 많은 워크플로우에서 타사 대비 수십 배 절감이 가능한 구조다. V4-Flash는 입력 0.14달러, 출력 0.28달러로 더 싸다.
다만 7월 중순 V4 정식 출시를 앞두고 피크 시간대 요금 2배 인상 계획이 발표됐다. 베이징 시간 기준 오전 9시부터 정오, 오후 2시부터 6시까지다. 저가 경쟁에서 운영 효율 중심으로 요금 전략이 바뀌는 신호라, 단가 안정성은 계속 지켜봐야 할 변수다.
벤치마크보다 청구서를 먼저 보라
MoE의 진짜 의미는 성능이 아니라 단가다. 1.6조 개를 들고 있으면서 490억 개만 켠다. 가장 비싼 모델을 가장 싸게 쓰는 전략 그 자체다. 도입 담당자가 제일 먼저 계산해야 할 건 벤치마크 점수가 아니라 활성화 비용과 캐시 히트율이다. 같은 작업에 10분의 1 비용이면, 남는 90%는 다른 문제에 쓸 수 있다. 더 많은 실험을 돌리거나, 더 비싼 모델이 필요한 소수 작업에 집중 투입할 수 있다.
AI 도입의 단위 비용이 바닥을 뚫고 있는 지금, 청구서를 먼저 읽는 기업이 내일의 경쟁력을 산다. 토큰 하나당 켜지는 490억 개의 전문가가 당신의 예산을 지키고 있다.
참고 자료
- 딥시크 V4 기술논문(MoE·CSA·HCA 아키텍처 설명)
- 딥시크 5월 31일 가격정책 발표
- GPT-5.5 공식 가격(비교 기준)
- 딥시크 V4 mHC 잔차연결·Muon 옵티마이저 등 학습 안정화 기법 설명