TangYi Studio

탕이 인사이트

Qwen3.8-Max와 Qwen3.8-27B는 25배 차이, 우리는 한 번 잘못 골랐다

林政賢 ·

이 글의 첫 번째 버전은 독자에게 2.4조 파라미터짜리 모델을 게이밍 PC에 설치하라고 할 뻔했다. 발견한 건 발행 30초 전. 그래서 이 글은 '우리가 어떻게 잘못 골랐나'에서 시작한다.

이름에 'Max'가 붙은 모델을 게이밍 PC에 넣으면 안 되는 이유

이름 짓기는 애초에 돌아가는지 판단하기 쉽게 하려는 게 아니라, 제품 라인의 상하를 줄 세우기 위한 것이다. 'Max', 'Ultra', 'Pro'는 그 회사 라인업에서 최상위 — 파라미터가 가장 많고, 능력이 가장 강하며, 동시에 소비자용 그래픽카드에 가장 안 들어가는 놈이다.

Qwen3.8-Max가 딱 그렇다. 알리바바가 2026년 8월 2일 발표한 2.4조 파라미터 MoE 모델로, 추론마다 약 950억 파라미터가 활성화되고 컨텍스트는 최대 100만 토큰이다. 이런 건 원래 서버실, 서버 한 줄이 늘어선 환경에서 돌리려고 설계된 것이다. 일주일 안에 공식이 가중치까지 공개했지만, 가중치가 공개됐다고 당신 집에서 돌아간다는 뜻은 아니다.

문제는 이 이름들이 너무 매력적이라는 것. '어차피 내 컴퓨터에서 돌릴 거면 당연히 제일 강한 걸 골라야지'라고 무의식적으로 생각하게 만든다. 이 직감은 틀렸다. 로컬에서 돌아가느냐는 모델이 강하냐와 아무 상관이 없다. 딱 한 가지와만 관련 있다. 파일이 당신 VRAM에 들어가느냐.

그래서 규칙은 간단하다. 숫자 두 개만 본다.

숫자 하나이 버전의 파일이 몇 GB인가
숫자 둘당신 그래픽카드가 몇 GB인가

앞이 뒤보다 작거나 같아야 다음 단계를 논할 자격이 생긴다. 파라미터 수, 벤치마크 점수, 공식 사이트 문구가 얼마나 예쁜지 — 로컬에선 전부 소음이다. 보면 잘못 고르게 될 뿐, 제대로 고르는 데 도움이 안 된다.

그래픽카드가 몇 GB냐가 어떤 버전을 돌릴 수 있는지 결정한다

진짜 봐야 할 건 Qwen3.8-27B다. 2026년 8월 14일 가중치가 공개된 277.8억 파라미터의 밀집(dense) 모델, Apache 2.0 라이선스, 이미지와 영상 입력을 네이티브로 지원, 컨텍스트 262,144 토큰. Qwen-Max급 능력이 소비자용 그래픽카드 한 장으로 돌아가는 크기에 담긴 건 이번이 처음이다.

27B 자체도 여러 압축 버전으로 나뉘어 각기 다른 VRAM에 대응한다. 우리가 8월 말 다운로드 페이지에서 본 파일 크기 기준:

24GB 카드 → Q4_K_M, 파일 17.11 GB

20GB 카드 → Q4_K_S, 파일 16.12 GB

16GB 카드 → Q3_K_M, 파일 13.82 GB

12GB 이하 → 27B를 억지로 올리지 말고 8B급 버전을 보라

이름의 숫자가 작을수록 압축이 세고, 파일은 작고, 모델은 멍청해진다 — 똑똑함을 공간과 맞바꾸는 것이며 예외는 없다.

VRAM을 꽉 채우지 마라. 지식 베이스를 돌릴 땐 대화 맥락과 검색용 소형 모델을 둘 자리도 필요하다. 실제로는 7~8할까지만 쓰는 게 안전하다. 나머지는 시스템을 위한 공간이지, 모델 하나 더 얹으라고 남긴 게 아니다.

LM Studio에는 GPU Offload라는 설정이 있다. 모델의 레이어를 몇 개나 그래픽카드에 올릴지라는 뜻이다. 많은 튜토리얼이 그냥 최대로 올리라고 하는데, 틀린 조언이다 — 들어가면 최대로 해도 되지만, 안 들어가는데 최대로 하면 뻗거나 못 쓸 만큼 느려질 뿐이다. 올바른 방법은 위로 조정하면서 LM Studio 자체 추정치가 당신 VRAM 바로 아래에 닿을 때 멈추는 것이다.

Mac 사용자는 규칙이 다르다. Apple Silicon의 메모리는 CPU와 GPU가 공유하는 통합 메모리라 32GB 이상이어야 27B가 돌아간다. PC용 대조표를 그대로 끼워 맞추면 안 된다.

모델을 설치한 건 빈 껍데기일 뿐, RAG가 당신 자료를 읽는 방법이다

카드를 꽂고 모델을 띄웠다. 그건 그저 박식한 빈 껍데기다. 당신 메모를 본 적도 없고, 지난달 서명한 계약서가 어떻게 생겼는지도 모른다. 읽게 만드는 기술이 RAG(Retrieval-Augmented Generation, 검색 증강 생성)다. 질문하면 시스템이 먼저 당신 폴더에서 관련 단락을 건져 내고, 질문과 함께 모델에 넘겨 그 단락에 따라 답하게 한다. 모델 자체는 바뀌지 않는다. 바뀌는 건 답하기 전에 무엇을 보느냐다.

초보자는 AnythingLLM을 바로 쓰는 게 가장 빠르다. 로컬 폴더를 지정하면 문서를 자동으로 벡터 인덱스로 변환한다. 하지만 결과물이 쓸 만한지는 세 가지에 달렸다.

초보자가 가장 흔히 저지르는 실수 하나 더: 모든 파일을 한 지식 베이스에 몽땅 쏟아 넣지 마라. 주제가 너무 다른 문서가 섞이면 검색 시 서로 간섭한다. 프로젝트나 주제별로 나눠 만드는 게 잡탕보다 훨씬 낫다.

AI가 준 답이 진짜인지, 지어낸 건지 어떻게 아나

시스템 지시에 경계를 분명히 긋고, '못 찾으면 못 찾았다고 해'라고 명확히 말하라. 모델이 지어내는 건 당신을 속이고 싶어서가 아니라, 당신 자료에서 답을 못 찾으면 범용 지식 속 '가장 그럴듯하게 들리는' 것을 자동으로 채워 넣기 때문이다. 실무에서 효과 있는 시스템 지시는 이렇다.

제공된 참고 문서에만 근거해 답하라. 답이 문서에 없으면 "제공된 자료에서 답을 찾을 수 없습니다"라고만 답하라. 문서 밖의 정보를 보충하는 것을 금지한다.

지시는 짧을 필요 없다. 명확해야 한다. 인터넷에 '지시가 짧을수록 성능이 좋다'는 말이 있는데, 그 영향은 무시해도 될 만큼 작다 — 성패를 정하는 건 '모르면 모른다고 해'를 분명히 썼느냐다.

다음은 많은 사람이 잘못 아는 것. AI에게 출처 문서를 붙이라고 요구하는 건 유용하다. 어느 파일을 펼쳐야 할지 알려 주니까. 하지만 '출처를 달았느냐'를 진위의 기준으로 삼으면 안 된다 — 모델은 출처까지 함께 지어낼 수 있고, 형식은 완전히 정상으로 보인다. 진짜 검증은 딱 하나. 그 문서를 열어 그 구절이 정말 거기 있는지 확인하는 것.

우리는 Content Copilot(우리의 콘텐츠 생산 시스템)을 만들 때 모델의 자기 선언을 믿는 대신 검증을 워크플로의 일부로 만들었다. 영상 모듈은 아직 개발 중이고, 텍스트 모듈은 이미 이 원칙대로 돌아가고 있다. 모델이 여전히 자주 딴소리를 한다면 서둘러 모델을 바꾸지 마라. 대개 분할이 문제다 — 중첩을 올리거나, 그 문서만 따로 빼서 작은 지식 베이스를 만들면 보통 해결된다.

지금 당장 할 수 있는 한 가지: 30초 확인으로 하룻밤을 아낀다

먼저 그래픽카드가 몇 GB인지 확인하라. Windows는 Ctrl + Shift + Esc로 작업 관리자를 열고 '성능' 탭에서 왼쪽의 GPU를 눌러 '전용 GPU 메모리'를 본다. Mac은 '이 Mac에 관하여'의 메모리 용량을 본다. 32GB 이상이어야 돌아간다.

16GB 이상이면 LM Studio를 설치해 먼저 모델을 띄우고 몇 마디 나눠 속도가 받아들일 만한지 확인한 뒤, 다시 AnythingLLM을 설치해 지식 베이스를 연결하라. 순서를 거꾸로 하지 마라. 모델 문제인지 검색 문제인지 구분이 안 된다.

다운로드 전에 공식 페이지에서 파일 크기가 정말 카드에 들어가는지 확인하라. 아무리 확신에 차서 쓰여 있어도 2차로 정리된 튜토리얼은 믿지 마라. 이 단계는 30초도 안 걸리고 하룻밤을 아껴 준다 — 우리는 바로 이걸로 이 글의 첫 버전을 붙잡아 Qwen3.8-Max를 Qwen3.8-27B로 바꿨다.

우리가 로컬 모델을 실제 생산 라인에 어떻게 연결하는지 보고 싶다면 AI 데모에 완전한 분석이 있다.

이 글의 숫자에 대하여: Qwen3.8-Max(2.4조 파라미터 MoE, 약 950억 활성, 1M 컨텍스트, 2026-08-02 발표)와 Qwen3.8-27B(277.8억 파라미터, Apache 2.0, 262,144 컨텍스트, 2026-08-14 가중치 공개)는 알리바바 클라우드 공식 발표에 따른 것이다. 각 압축 버전의 파일 크기는 2026년 8월 말 다운로드 페이지 표시이며 이후 빌드에 따라 달라질 수 있으니, 다운로드 시점의 페이지를 기준으로 삼길 바란다.

저자:林政賢(감독 · Gen AI 크리에이터 겸 엔지니어 · 탕이 스튜디오 창업자)