📋
핵심 요약
sLLM 비교 시리즈 3편 — 사내 서버 CPU-only 환경에서 Gemma 2 9B와 Phi-3 Mini 3.8B를 비교했다.
Phi-3는 가볍고(4GB RAM, ~25 tok/s) 라이선스도 MIT로 자유롭지만 한글 처리가 아쉽고, Gemma 2는 더 무겁지만(8GB RAM, ~15 tok/s) 한글 자연스러움이 한 수 위다.
실무 판단: 한글이 필수면 Gemma 2, 가볍게 붙이고 싶으면 Phi-3 — CPU-only 서버에서도 전표 한 건 분류엔 2~3초면 충분하다.
sLLM 비교 시리즈 3편 — 사내 서버 CPU-only 환경에서 Gemma 2 9B와 Phi-3 Mini 3.8B를 비교했다.
Phi-3는 가볍고(4GB RAM, ~25 tok/s) 라이선스도 MIT로 자유롭지만 한글 처리가 아쉽고, Gemma 2는 더 무겁지만(8GB RAM, ~15 tok/s) 한글 자연스러움이 한 수 위다.
실무 판단: 한글이 필수면 Gemma 2, 가볍게 붙이고 싶으면 Phi-3 — CPU-only 서버에서도 전표 한 건 분류엔 2~3초면 충분하다.
클라우드 API는 편하지만, 개인정보나 내부 데이터를 외부로 보내기 꺼려지는 기업이 많다. 이럴 때 필요한 건 사내 서버에서 돌아가는 경량 모델. 이번 편은 CPU-only 환경에서 실제로 쓸 만한 두 모델을 비교한다.
한눈에 비교
| 기준 | Gemma 2 9B | Phi-3 Mini |
|---|---|---|
| 출시 | 2024.06 | 2024.04 |
| 크기 | 9B | 3.8B |
| CPU 추론 속도 | ~15 tok/s | ~25 tok/s |
| RAM 필요 | 8GB | 4GB |
| MMLU | 71.3% | 69.8% |
| 한글 품질 | ★★★☆☆ | ★★☆☆☆ |
| 라이선스 | Gemma (상업용 OK) | MIT |
속도 vs 품질: 생각보다 큰 차이
Phi-3는 3.8B로 가볍지만 한글 처리에서 아쉽다. Gemma 2는 9B로 더 무겁지만 한글 자연스러움이 한 수 위. 다만 CPU-only 서버에서는 Gemma 2의 15 tok/s도 실무에 쓸 만한 수준. 전표 한 건 분류에 2~3초면 충분하다.
실무 판단
- 한글 필수면: Gemma 2. 조금 느려도 결과가 낫다.
- 가볍게 붙이고 싶으면: Phi-3. 4GB RAM이면 충분.
참고 자료
- Google Gemma 2, Microsoft Phi-3 공식 스펙 및 MMLU 벤치마크 — 본문 비교표 기준 CPU 추론 속도·한글 품질 비교
- sLLM 실전 비교 시리즈 3편 — 온프레미스 사내 서버 구동 가능성 중심 비교 (본문 언급)