E2B는 되는데, 그게 끝이었다
Gemma 4가 오늘(2026년 4월 3일) 출시됐다는 소식을 듣고 바로 Ollama로 설치해봤다. 결론부터 말하면, RTX 3080 Ti(12GB)로는 E2B 하나만 현실적으로 돌아간다. E4B는 아슬아슬하게 올라가는 척 하다가 컨텍스트가 길어지면 금방 한계를 드러냈고, 26B MoE 이상은 처음부터 시도조차 못 했다. 이 글은 그 과정과, 이제 24GB짜리를 사야 하나 고민하는 이야기다.
설치는 5분이면 끝난다
Ollama가 이미 설치돼 있었기 때문에 명령어 하나로 끝났다.
ollama run gemma4
기본값이 gemma4:e4b(9.6GB)라는 건 나중에 알았다. 처음엔 그냥 돌렸다가 응답 속도가 이상하게 느려서 확인해보니 컨텍스트가 조금만 쌓여도 VRAM이 꽉 차고 있었다. 그래서 E2B로 내렸다.
# E2B로 명시해서 실행ollama run gemma4:e2b
E2B 실행 결과: 빠르긴 한데, 아쉽다
E2B(7.2GB)는 3080 Ti에서 꽤 쾌적하게 돌아간다. 측정해보니 약 50~60 tokens/s 수준이었다. 짧은 질문엔 응답이 거의 즉각적으로 느껴질 정도고, 코드 보조 정도의 작업에서는 실용적인 속도다.
문제는 품질이다. E2B는 “효과적인 2B 파라미터” 모델이다. 벤치마크 수치로 보면 MMLU-Pro 기준 60%인데, 실제로 조금 복잡한 추론이나 긴 코드 분석을 시키면 한계가 느껴진다. 그냥 요약이나 간단한 Q&A 수준에서는 충분하지만, 그 이상을 바라면 금방 답답해진다.
Gemma 4 E2B의 솔직한 체감: 빠르고 가볍다. 단순 작업엔 쓸 만하다. 복잡한 추론을 기대하면 안 된다. E4B와의 품질 차이가 생각보다 크다.
E4B는 왜 안 되는가
E4B는 9.6GB짜리다. 12GB에 들어가는 것처럼 보이지만, 실제로는 그렇게 단순하지 않다. Ollama가 모델을 올릴 때 런타임 오버헤드가 추가되고, 대화가 길어질수록 KV 캐시가 늘어나면서 남은 VRAM을 빠르게 잠식한다.
- 짧은 대화 (2~3턴): 겨우 들어간다
- 중간 길이 대화 (10턴 이상): VRAM 한계, 응답 속도 급락
- 긴 문서 분석: RAM 오프로드 발생, 사실상 사용 불가 속도
결국 E4B는 “로드는 되는데 쓰기 불편한” 상태다. 일상적으로 쓰려면 대화를 짧게 유지해야 한다는 제약이 생기는데, 그러면 굳이 E4B를 쓸 이유가 없어진다.
26B MoE는 처음부터 불가
26B MoE는 18GB다. 12GB 카드엔 올라가지조차 않는다. 시도하면 Ollama가 일부를 RAM으로 오프로드하는데, PCIe 버스를 통해 VRAM↔RAM을 왔다갔다 하는 구조라 속도가 수십 배 떨어진다. 사실상 의미 없는 실행이다.
이게 제일 아쉽다. Gemma 4 라인업에서 가성비 최고점은 26B MoE인데, 18GB를 올리면서도 추론 시엔 4B만 활성화되는 구조라 E4B보다 훨씬 높은 품질을 비슷한 속도로 낼 수 있다고 한다. MMLU-Pro 82.6% vs E4B의 69.4%인데, 이 차이를 경험해보지 못한다는 게 답답하다.
현실: 24GB가 필요하다
Gemma 4를 제대로 쓰려면 VRAM 24GB가 기준선이다. 소비자용 그래픽카드 중 24GB는 현재 두 가지 선택지가 있다.
| 모델 | VRAM | 중고 시세 (2026년 4월 기준) | 특징 |
|---|---|---|---|
| RTX 3090 | 24GB | 약 90~130만원 | Ampere, 메모리 대역폭 936 GB/s |
| RTX 4090 | 24GB | 약 220~260만원 | Ada Lovelace, 대역폭 1,008 GB/s, 훨씬 빠름 |
중고나라와 번개장터 기준으로 RTX 3090은 90~130만원대에 매물이 있다. RTX 4090은 220만원 아래로 내려오지 않는다. 5090이 나왔음에도 4090 중고 가격은 생각만큼 떨어지지 않았다.
3090을 살까, 4090을 살까
솔직히 AI 로컬 추론 용도로만 본다면 3090이 더 합리적인 선택이다. Gemma 4 기준으로 두 카드의 실질적인 차이를 보면:
- 실행 가능 모델: 동일 (둘 다 26B MoE까지 가능)
- 속도 차이: 4090이 약 40~60% 빠름 (대역폭 차이)
- 가격 차이: 4090이 약 120~150만원 더 비쌈
- 전력 소모: 3090이 약 350W, 4090이 약 450W
응답 속도가 중요한 작업을 한다면 4090이 낫다. 하지만 어차피 로컬 AI는 혼자 쓰는 용도고, 26B MoE가 30 tokens/s가 나오든 50 tokens/s가 나오든 사람이 읽기엔 둘 다 충분히 빠르다. 그 속도 차이에 130만원을 더 쓸 이유가 명확하지 않다.
다만 3090 중고를 살 때 주의할 점이 있다. 3090은 출시된 지 5년이 넘은 카드다. 채굴이나 고강도 AI 연산에 혹사된 매물이 섞여 있을 수 있어서, 구매 전 상태 확인이 4090보다 더 중요하다.
3080 Ti를 팔아야 할까
RTX 3080 Ti 중고 시세는 현재 40~55만원 수준이다. 3090을 90~100만원에 산다면 실질 지출은 40~60만원 선. 이 정도면 살 만하다고 생각하는데, 아직 결정을 못 했다.
솔직히 E2B도 일상 사용엔 나쁘지 않다. 빠르고 안정적이다. 문제는 “26B MoE를 못 쓴다는 사실”이 자꾸 머릿속에 걸린다는 거다. Gemma 4 26B MoE가 AIME 2026에서 88.3%를 찍었다는 벤치마크를 보면, 내 현재 환경에서 그걸 경험하지 못한다는 게 아깝다.
결론을 내리진 못했지만, 방향은 3090 중고 쪽으로 기울고 있다. 매물 상태 좋은 게 나오면 바꿔볼 생각이다.
지금 3080 Ti를 갖고 있다면
- E2B로 시작하고, 단순 작업 위주로 쓴다면 충분히 실용적이다
- E4B는 대화를 매우 짧게 유지해야만 사용 가능하다
- 26B 이상을 쓰고 싶다면 24GB 업그레이드 말고는 방법이 없다
- 업그레이드 예산이 50만원 내외라면 RTX 3090 중고가 현재 유일한 선택지다
- 4090은 130만원 프리미엄의 가치를 AI 추론 용도로 정당화하기 어렵다