그래픽카드 메모리(VRAM)가 8GB면 12B급은 사실상 포기하게 된다.
내 RTX 3070에서 12B를 돌려 봤더니 GPU에 다 올라가지 못했다. 초당 14.7 토큰. 7B의 5분의 1이었다.
그런데 7월 21일에 나온 3B 하나가 그 12B를 이겼다고 한다.
만든 곳이 공개한 표에서 Nanbeige4.2-3B는 에이전트와 추론 항목 대부분에서 Gemma4-12B와 Qwen3.5-9B보다 점수가 높다.
파일은 2.7GB다. 8GB에 넉넉히 들어간다.
이게 사실이면 8GB에서 포기했던 급이 돌아온다는 뜻이다. 그래서 받았다.
안 켜졌다.
파일이 깨진 것도 아니고 메모리가 모자란 것도 아니었다.

📌 무엇이 나왔나
7월 21일에 Nanbeige4.2-3B가 공개됐다.
좋아요 652개에 3만 4천 회 넘게 받아 갔다.
구조가 특이하다.
Looped Transformer라고 해서 트랜스포머 층을 다시 돌려 쓴다. 파라미터를 늘리지 않고 용량만 키우는 방식이다.
기술 보고서도 arXiv에 같이 올라왔다.
출처: https://huggingface.co/Nanbeige/Nanbeige4.2-3B
📦 GGUF는 이미 넘쳐났다
공개 당일에 GGUF 파일이 올라왔다.
GGUF는 개인 PC에서 돌릴 수 있게 모델을 압축해 담은 파일 형식이다. 로컬에서 쓰려면 이게 있어야 한다.
만든 곳이 올린 게 아니었다.
다른 사람들이 직접 변환해서 올린 사본이다. 이런 걸 미러라고 부른다.
| 저장소 | 올라온 날 | 받아 간 횟수 |
|---|---|---|
| owao | 7월 21일 | 58,814 |
| Abiray | 7월 22일 | 11,652 |
| bartowski | 7월 28일 | 7,884 |
세 곳을 합치면 78,350회다. 허깅페이스 API로 직접 조회한 값이다.
⚠️ 받아서 실행했더니
내 PC는 윈도우 11에 RTX 3070, VRAM 8GB다. ollama는 0.32.5를 쓴다.
받는 건 문제없이 끝났다.
2.7GB짜리가 정상적으로 내려왔다.
그리고 실행에서 멈췄다.
error loading model: unknown model architecture: 'nanbeige'
ollama가 모르는 구조라는 뜻이다.
파일은 멀쩡한데 읽는 쪽이 그 형식을 몰랐다.
🔀 여기서 갈리는 지점
로컬에서 모델을 돌리려면 따로 필요한 게 있다.
파일 하나, 그리고 그 파일을 읽을 줄 아는 런타임.
GGUF 파일은 누구나 변환해서 올릴 수 있다.
그래서 공개 당일에 미러가 생긴다.
런타임 쪽은 사정이 다르다.
새 구조를 이해하려면 코드가 들어가야 한다. 사람이 짜서 병합해야 한다.
받을 수 있다는 게 돌아간다는 뜻은 아니었다.
🗓️ 날짜를 붙여 보면
ollama는 모델을 돌리는 엔진을 직접 만들지 않는다. llama.cpp라는 별도 프로그램의 엔진을 가져다 쓴다.
그래서 새 구조를 지원하는 코드는 llama.cpp에 먼저 들어가고, 그게 ollama에 실리기까지 한 번 더 시간이 걸린다.
날짜를 나란히 놓으면 이렇게 된다.
| 날짜 | 일어난 일 | 무슨 뜻인가 |
|---|---|---|
| 7월 21일 | 모델 공개 · 같은 날 GGUF 미러 등장 | 파일은 첫날부터 받을 수 있었다 |
| 7월 24일 | llama.cpp에 지원 요청 | 공식 버전으로는 못 돌린다는 신고였다 |
| 7월 27일 | llama.cpp 병합 완료 | 엔진 쪽은 해결됐다 |
| 7월 27일 | ollama 0.32.5 배포 | 같은 날이다. 지금 받을 수 있는 최신 버전이 이것이다 |
요청 글에는 "지금은 llama.cpp의 특별한 포크가 있어야 한다"고 적혀 있었다.
포크는 원본에서 갈라져 나온 별도 버전을 말한다. 공식 llama.cpp로는 안 되고, 이 모델용으로 따로 만든 버전을 받아 직접 빌드해야 한다는 뜻이다.
사흘 뒤 그 코드가 공식 llama.cpp에 합쳐졌다. llama.cpp 관리자가 "브랜치 병합됨, 닫는다"고 적고 요청 글을 닫았다.
병합과 배포가 같은 날이면 그 병합이 들어가기 어렵다. 내 PC에서 안 켜진 이유가 여기 있을 가능성이 높다.
다만 이건 정황이다. ollama가 어느 시점의 llama.cpp를 담았는지 공식으로 밝힌 자료는 확인하지 못했다.
🔍 확인해 보는 법
모델이 안 켜질 때 나는 오류 문구부터 본다.
unknown model architecture가 보이면 파일 문제가 아니다.
다른 미러를 받아도 결과는 똑같다. 변환한 사람이 달라도 모델 구조는 같기 때문이다.
내가 할 수 있는 건 셋이었다.
런타임 업데이트를 기다리거나, llama.cpp를 직접 빌드하거나, 그냥 다른 모델을 쓰는 것.
🧷 남는 것
처음의 12B 얘기로 돌아가 보자.
같은 PC에서 7B는 4.59GB만 쓰고 GPU에 다 올라가 초당 77.2 토큰을 냈다.
12B는 GPU에 다 못 올라가 초당 14.7 토큰에 그쳤다. 77.2를 14.7로 나누면 5.3이다.
이 3B가 그 12B 자리를 대신할 수 있는지는, 켜져야 확인할 수 있는 얘기다.
Nanbeige4.2-3B는 아직 그 앞 단계에 있다.
새 구조가 나오면 성능 숫자가 먼저 돈다. 내 PC에서 켜지는지는 며칠에서 몇 주쯤 뒤에 정해진다.
그 사이가 지금이다.
llama.cpp에는 코드가 이미 들어갔다. ollama가 그걸 담은 버전을 내면 나는 다시 받아볼 생각이다.
그때 이 3B가 정말 12B 자리를 대신하는지 재보고 여기에 적겠다.
댓글
댓글 쓰기