/// NOTES · 연재 017

그래픽카드 없이 35B 모델

집 노트북에서 큰 모델을 돌려 보려다 그래픽카드에서 막히는 것이 늘 같은 자리였다. 그래픽카드 없이 메모리만으로 도는 것을 내건 350억짜리 모델이 하나 올라와 있길래 받기 전에 내 기계가 감당할 수 있는지부터 재 봤다. 숫자는 문서에 적힌 것, 나머지는 아직 못 재 본 것으로 갈라 적는다.

2026-09-16· 분류 : 모델· 직접 해 보기 20분(내려받기 시간 제외)

무엇이 올라와 있나

확인 허깅페이스 FINAL-Bench/POCKET-35B-GGUF 저장소에 GGUF 파일 네 개가 올라와 있다. 같은 모델을 정밀도만 다르게 줄여 놓은 것이고, 라이선스는 Apache 2.0. 저장소 전체는 59GB쯤 되지만 하나만 받으면 된다.

확인 모델 카드에 적힌 바탕은 Darwin-36B-Opus, 구조는 Qwen3.5 계열 MoE다. 한국어와 영어를 함께 내걸었고, 손전화·태블릿용으로는 POCKET-KR-GGUF(안드로이드) · POCKET-KR-MLX(아이폰·맥)가 따로 있다.

파일크기문서가 말하는 메모리메모
IQ1_M8.24 GB16 GB가장 작다. 대신 아래 경고를 먼저 읽을 것
Q2_K12.9 GB16~24 GB문서가 기본으로 권하는 것
Q3_K_M16.8 GB—중간
Q4_K_M21.2 GB32 GB품질이 가장 낫다

추정 메모리 16GB짜리 흔한 노트북이면 Q2_K가 경계선에 걸린다. 다른 것을 다 닫고 재야 한다는 뜻이다. 32GB면 Q4_K_M까지 여유가 있어 보인다. 내 기계에서 직접 재 본 것은 아니다.

왜 이게 눈에 들어왔나

이 사이트 교육 과정 L3·02 에서 로컬 모델의 기준은 딱 한 줄이라고 적었다 — 받을 파일 크기보다 메모리가 넉넉해야 한다. 그 한 줄을 그대로 대 보면 이 모델의 성격이 바로 보인다. 350억짜리인데 13GB 파일 하나로 줄어 있으니, 그동안 "메모리가 모자라서" 밀려났던 크기가 일반 노트북 쪽으로 한 칸 내려온 것이다.

확인 모델 카드는 그래픽카드를 아예 쓰지 않는 실행을 전제로 명령을 적어 두었다. -ngl 0 — 한 겹도 그래픽카드에 올리지 말라는 뜻이다. L3·01 에서 "포기하는 것"으로 적었던 속도를 어디까지 참을 수 있느냐의 문제로 바꿔 놓는다.

속도는 이렇게 적혀 있다

확인 모델 카드의 표에는 IQ1_M 기준 Xeon 16스레드에서 27.0 tok/s, Q2_K 기준 M3 Pro에서 19.5 tok/s 로 적혀 있다.

추정 다만 이 숫자는 만든 쪽이 잰 것이고 기계도 좋은 편이다. 오래된 노트북에서 같은 숫자가 나올 것이라고 보지 않는 편이 낫다. 어차피 내 기계에서 재 보는 것말고는 방법이 없다.

직접 해 보기 — 20분

  1. 내 메모리부터 잰다. 윈도우는 작업 관리자 → 성능 → 메모리. 전체가 아니라 지금 남아 있는 양을 본다. 남은 양이 위 표의 숫자보다 작으면 그 파일은 받아도 안 돈다 (L3·02).
  2. LM Studio 로 받는다. 확인 공식 문서 기준으로 Ctrl + 2(맥은 ⌘ + 2)를 누르면 Discover 탭이 열린다. 검색창에 저장소 이름을 그대로 붙여 넣으면 된다.
    FINAL-Bench/POCKET-35B-GGUF
    목록에서 Q2_K 를 고른다. 공식 문서는 기계가 받쳐 주면 4비트 이상을 권하니, 32GB 쓰는 사람은 Q4_K_M 쪽으로 간다.
  3. 명령으로 쓰는 쪽이면 llama.cpp 그대로면 된다. 확인 모델 카드에 적힌 명령은 이것 하나다. 고쳐 만든 것을 받을 필요가 없다고 적혀 있다.
    llama-cli -m POCKET-35B-Q2_K.gguf -p "안녕하세요" -ngl 0 -t 8
    -t 뒤 숫자는 실제 코어 수에 맞춘다. 스레드 수를 넘겨 적으면 오히려 느려진다.
  4. 한국어로 재 본다. 잘 되는 예시 말고, 내가 실제로 자주 시키는 것 세 개를 넣는다.
    아래 글을 다섯 줄로 줄여 줘. 사실만 남기고.
    (늘 쓰던 글 한 편을 그대로 붙여 넣는다)
    같은 세 개를 평소 쓰던 클라우드 쪽에도 넣어 나란히 둔다. 느낌이 아니라 나란히 놓고 고른다 — L2·04.
  5. 안 쓸 것 같으면 그날 지운다. 13GB짜리가 몇 개 쌓이면 금방 100GB가 된다. 받아 본 것과 남길 것을 같은 날 갈라 두는 편이 낫다.
가장 작은 것부터 받지 말 것

확인 모델 카드가 직접 적어 둔 경고다 — 가장 심하게 줄인 IQ1_M 에서는 한국어가 영어보다 약 2.8배 더 상한다. 파일이 작다고 이것부터 받으면 "35B인데 왜 이래" 를 하게 된다. 한국어로 쓸 생각이면 Q2_K 아래로는 내려가지 않는 편이 낫다.

확인 못 함 모델 카드에 적힌 GPQA-Diamond 68.7% 같은 점수는 만든 쪽이 스스로 잰 것이다. 바깥에서 다시 잰 결과를 찾지 못했다. 점수를 근거로 결정하지 않는 편이 안전하다.

확인 못 함 "공개 7주 만에 누적 100만 다운로드" 라는 기사도 있었는데, 내가 저장소에서 본 것은 최근 한 달 24만여 건이었다. 집계 기준이 다른 것으로 보이지만 어느 쪽이 맞는지는 확인하지 못했다.

한 줄 정리

  1. 그래픽카드 없이 돌리는 13GB짜리 35B 가 있다. 기준은 여전히 남은 메모리 하나다.
  2. 한국어로 쓸 거면 가장 작은 파일은 건너뛴다. 만든 쪽이 직접 적어 둔 경고다.
  3. 속도도 점수도 만든 쪽이 잰 숫자다. 내 기계에서 다시 재기 전까지는 참고만 한다.
이어 읽기 L3 · 02 로컬 모델 시작하기 — 내 기계 메모리를 재는 법과, 줄여 놓은 파일 중 어느 것을 받아야 하는지. →
SOURCES
  1. Hugging Face — FINAL-Bench/POCKET-35B-GGUF 모델 카드 (파일 크기 · 필요 메모리 · 실행 명령 · 한국어 품질 경고 · 자체 측정값)
  2. 같은 저장소 파일 목록 (IQ1_M 8.24GB · Q2_K 12.9GB · Q3_K_M 16.8GB · Q4_K_M 21.2GB)
  3. LM Studio 공식 문서 — Download an LLM (Discover 탭 · 저장소 이름으로 검색 · 4비트 이상 권장)
  4. AI타임스 — 포켓, 공개 7주 만에 100만 다운로드 (누적 다운로드 주장 · 본문에서 확인 못 함으로 표시)