기본 콘텐츠로 건너뛰기

12B를 이겼다는 3B, 내 8GB 카드에서 켜지지도 않았다

그래픽카드 메모리(VRAM)가 8GB면 12B급은 사실상 포기하게 된다.

내 RTX 3070에서 12B를 돌려 봤더니 GPU에 다 올라가지 못했다. 초당 14.7 토큰. 7B의 5분의 1이었다.

그런데 7월 21일에 나온 3B 하나가 그 12B를 이겼다고 한다.

만든 곳이 공개한 표에서 Nanbeige4.2-3B는 에이전트와 추론 항목 대부분에서 Gemma4-12B와 Qwen3.5-9B보다 점수가 높다.

파일은 2.7GB다. 8GB에 넉넉히 들어간다.

이게 사실이면 8GB에서 포기했던 급이 돌아온다는 뜻이다. 그래서 받았다.

안 켜졌다.

파일이 깨진 것도 아니고 메모리가 모자란 것도 아니었다.

파일은 받았는데 런타임이 열지 못하는 상황

📌 무엇이 나왔나

7월 21일에 Nanbeige4.2-3B가 공개됐다.

좋아요 652개에 3만 4천 회 넘게 받아 갔다.

구조가 특이하다.

Looped Transformer라고 해서 트랜스포머 층을 다시 돌려 쓴다. 파라미터를 늘리지 않고 용량만 키우는 방식이다.

기술 보고서도 arXiv에 같이 올라왔다.

출처: https://huggingface.co/Nanbeige/Nanbeige4.2-3B

📦 GGUF는 이미 넘쳐났다

공개 당일에 GGUF 파일이 올라왔다.

GGUF는 개인 PC에서 돌릴 수 있게 모델을 압축해 담은 파일 형식이다. 로컬에서 쓰려면 이게 있어야 한다.

만든 곳이 올린 게 아니었다.

다른 사람들이 직접 변환해서 올린 사본이다. 이런 걸 미러라고 부른다.

저장소올라온 날받아 간 횟수
owao7월 21일58,814
Abiray7월 22일11,652
bartowski7월 28일7,884

세 곳을 합치면 78,350회다. 허깅페이스 API로 직접 조회한 값이다.

⚠️ 받아서 실행했더니

내 PC는 윈도우 11에 RTX 3070, VRAM 8GB다. ollama는 0.32.5를 쓴다.

받는 건 문제없이 끝났다.

2.7GB짜리가 정상적으로 내려왔다.

그리고 실행에서 멈췄다.

error loading model: unknown model architecture: 'nanbeige'

ollama가 모르는 구조라는 뜻이다.

파일은 멀쩡한데 읽는 쪽이 그 형식을 몰랐다.

🔀 여기서 갈리는 지점

로컬에서 모델을 돌리려면 따로 필요한 게 있다.

파일 하나, 그리고 그 파일을 읽을 줄 아는 런타임.

GGUF 파일은 누구나 변환해서 올릴 수 있다.

그래서 공개 당일에 미러가 생긴다.

런타임 쪽은 사정이 다르다.

새 구조를 이해하려면 코드가 들어가야 한다. 사람이 짜서 병합해야 한다.

받을 수 있다는 게 돌아간다는 뜻은 아니었다.

🗓️ 날짜를 붙여 보면

ollama는 모델을 돌리는 엔진을 직접 만들지 않는다. llama.cpp라는 별도 프로그램의 엔진을 가져다 쓴다.

그래서 새 구조를 지원하는 코드는 llama.cpp에 먼저 들어가고, 그게 ollama에 실리기까지 한 번 더 시간이 걸린다.

날짜를 나란히 놓으면 이렇게 된다.

날짜일어난 일무슨 뜻인가
7월 21일모델 공개 · 같은 날 GGUF 미러 등장파일은 첫날부터 받을 수 있었다
7월 24일llama.cpp에 지원 요청공식 버전으로는 못 돌린다는 신고였다
7월 27일llama.cpp 병합 완료엔진 쪽은 해결됐다
7월 27일ollama 0.32.5 배포같은 날이다. 지금 받을 수 있는 최신 버전이 이것이다

요청 글에는 "지금은 llama.cpp의 특별한 포크가 있어야 한다"고 적혀 있었다.

포크는 원본에서 갈라져 나온 별도 버전을 말한다. 공식 llama.cpp로는 안 되고, 이 모델용으로 따로 만든 버전을 받아 직접 빌드해야 한다는 뜻이다.

사흘 뒤 그 코드가 공식 llama.cpp에 합쳐졌다. llama.cpp 관리자가 "브랜치 병합됨, 닫는다"고 적고 요청 글을 닫았다.

병합과 배포가 같은 날이면 그 병합이 들어가기 어렵다. 내 PC에서 안 켜진 이유가 여기 있을 가능성이 높다.

다만 이건 정황이다. ollama가 어느 시점의 llama.cpp를 담았는지 공식으로 밝힌 자료는 확인하지 못했다.

🔍 확인해 보는 법

모델이 안 켜질 때 나는 오류 문구부터 본다.

unknown model architecture가 보이면 파일 문제가 아니다.

다른 미러를 받아도 결과는 똑같다. 변환한 사람이 달라도 모델 구조는 같기 때문이다.

내가 할 수 있는 건 셋이었다.

런타임 업데이트를 기다리거나, llama.cpp를 직접 빌드하거나, 그냥 다른 모델을 쓰는 것.

🧷 남는 것

처음의 12B 얘기로 돌아가 보자.

같은 PC에서 7B는 4.59GB만 쓰고 GPU에 다 올라가 초당 77.2 토큰을 냈다.

12B는 GPU에 다 못 올라가 초당 14.7 토큰에 그쳤다. 77.2를 14.7로 나누면 5.3이다.

이 3B가 그 12B 자리를 대신할 수 있는지는, 켜져야 확인할 수 있는 얘기다.

Nanbeige4.2-3B는 아직 그 앞 단계에 있다.

새 구조가 나오면 성능 숫자가 먼저 돈다. 내 PC에서 켜지는지는 며칠에서 몇 주쯤 뒤에 정해진다.

그 사이가 지금이다.

llama.cpp에는 코드가 이미 들어갔다. ollama가 그걸 담은 버전을 내면 나는 다시 받아볼 생각이다.

그때 이 3B가 정말 12B 자리를 대신하는지 재보고 여기에 적겠다.

댓글

이 블로그의 인기 게시물

AI 데이터센터 전기요금은 계약서에서 갈린다 — 조지아파워가 스스로 공개한 4가지 장치

우편함에서 전기요금 고지서를 꺼낸다. 봉투를 뜯고 지난달 사용량 옆에 붙은 청구액을 확인한다. 매일 쓰는 ChatGPT와 한 달에 한 번 보는 전기요금 고지서가 같은 기사 안에 묶인다. 몇 주 전부터 AI 데이터센터 전기요금이 오른다는 기사를 몇 번 봤다. 그 기사가 사실인지 겁주기인지 판단할 방법은 없었다. 오픈AI가 조지아주 에핑엄 카운티에서 데이터센터 프로젝트를 발표했다. 전력은 조지아파워가 공급한다. 예상 전력 수요는 약 3,200MW다. 오픈AI는 이 중 최대 1,000MW를 유연 수요반응으로 제공하기로 했다. 전력이 몰리는 시간대에 자기 사용량을 그만큼 줄이겠다는 약정이다. 계약 기간은 25년이다. 조지아 공공서비스위원회(PSC)는 관련 규칙을 2025년 1월에 처음 승인했다. 조지아파워는 2029년부터 일반 가정 요금을 연 102달러 낮출 계획이라고 말한다. 발표문이 스스로 공개한 것들 조지아파워의 보도자료는 이 계약을 "고객 보호"라는 말로 여러 번 설명한다. 비용 부담을 오픈AI가 진다. 회사는 오픈AI가 인프라와 전력 서비스 비용 전액을 부담한다고 말한다. 재무 보증도 계약에 들어간다. 회사는 조지아파워 고객을 보호하도록 설계된 "financial assurances"가 포함된다고 말한다. 구체적인 형태나 금액은 보도자료에 나오지 않는다. 수요반응 약정도 있다. 오픈AI는 전력 수요가 높은 시간대에 최대 1,000MW까지 사용량을 줄이기로 동의했다. 회사는 이 규모가 미국에서 단일 시설 기준으로 가장 큰 수요반응 약정 중 하나라고 말한다. 공급 조정권은 조지아파워가 갖는다. 25년 계약 아래에서 조지아파워는 특정 시간대에 오픈AI 시설로 가는 전력을 줄일 권한을 갖는다. 전력망 안정을 위해서라고 회사는 설명한다. 이 네 장치, 위험은 어디로 가는가 AI 데이터센터 전기요금이 오르내리는 방향은 이 네 장치가 정한다. 비용 전액 부담은 위험을 오픈AI 쪽에 ...

모두의 AI는 한국형 모델을 공짜로 푸는 사업인가

‘전 국민 무료 국산 AI’라는 문장을 보면, 앱부터 찾게 된다. 공고는 이미 나왔다.[1] 서비스 출시는 앞으로 추진된다.[3] 공식 문서가 보여 주는 현재 단계는 앱 배포가 아니다. 서비스를 만들 사업자를 뽑고, 출시를 추진하는 단계다.[1][3] 이 차이가 중요해 보인다. 지금까지 확인된 일 정보통신산업진흥원(NIPA)은 2026년 7월 13일 전 국민 AI 서비스 보편적 활용 지원(모두의 AI) 사업 을 공고했다.[1] 신청 마감은 수정 공고로 8월 18일 17시까지 연장됐다.[2] 개인정보보호 관련 제재조치 사항도 함께 수정됐다.[2] 과기정통부는 민간 기업 2~3개를 선정해 범용 AI 챗봇과 공공 AI 에이전트 출시를 추진한다고 밝혔다.[3] 정부는 연내 한국 AI 모델 기반 범용 챗봇의 출시 목표를 제시했다.[4] 이용 조건은 비용 부담과 이용량 제한이 없다는 방향이다.[4] 이름 하나에 모델과 서비스를 섞지 않기 공식 사업명은 전 국민 AI 서비스 보편적 활용 지원(모두의 AI) 사업 이다.[1] 우리 AI 모델 은 서비스의 기반을 가리킨다.[4] 범용 AI 챗봇 과 공공 AI 에이전트 는 국민이 접하게 될 서비스 형태다.[3][4] 공공 AI 에이전트는 청년지원금 같은 정부 지원 혜택을 안내하고 신청까지 대행하겠다고 밝힌 서비스를 가리킨다.[4] 이름이 가리키는 대상은 선정 사업자가 모델을 활용해 만들 서비스의 개발·출시 사업이다.[1][3] 이미 배포된 단일 모델명으로 읽을 근거는 여기서 찾기 어렵다. 모델 성능 목표와 서비스 출시 목표는 다른 일정이다 과기정통부는 서비스 출시 계획과 함께, 정부가 확보·고도화하려는 국산 기반 모델인 독자 AI 모델의 계획도 따로 밝혔다.[4] 하반기에는 글로벌 10위권 성능 모델 확보를 목표로 했다.[4] 2027년에는 글로벌 최상위급 모델 확보를 목표로 한다.[4] 두 목표는 한 문서 안에서도 별도 일정으로 제시된다.[4] 확인된 것은 사업 공고와 선정·출시...