[태그:] 로컬 LLM

  • Qwen3.8-Max는 지금 쓸 수 있을까? API 사용 경로와 오픈웨이트 공개 일정

    Qwen3.8-Max는 지금 쓸 수 있을까? API 사용 경로와 오픈웨이트 공개 일정

    2026년 8월 4일 기준, Qwen3.8-Max는 지금 사용할 수 있습니다. 다만 현재 가능한 방식은 알리바바 클라우드의 API나 Qwen Code 같은 클라우드 연결 방식입니다.

    모델 파일을 내려받아 Ollama나 LM Studio로 실행하는 것은 아직 어렵습니다. Qwen 팀은 Qwen3.8-Max의 가중치를 다음 주에 공개하겠다고 발표했지만, 현재 확인되는 공식 자료에는 다운로드 주소와 최종 라이선스가 나오지 않았습니다.

    Qwen3.8-Max 현재 사용 가능 여부

    사용 방법현재 가능 여부확인할 사항
    Alibaba Cloud Model Studio API가능모델 ID는 qwen3.8-max
    OpenAI 호환 API가능지역별 Base URL과 Workspace ID 필요
    Anthropic 호환 API가능Claude Code 등과 연결 가능
    Qwen Code가능Model Studio API 키 또는 지원 요금제 필요
    Qwen3.8-Max-Preview가능정식판과 별도 모델이므로 혼동 주의
    Hugging Face·ModelScope에서 가중치 다운로드아직 공개 전다음 주 공개 예고
    Ollama·LM Studio 로컬 실행현재 불가공식 가중치와 변환 파일이 공개된 뒤 확인
    일반 PC에서 Qwen3.8-Max 전체 모델 실행현실적으로 어려울 가능성이 큼2.4조 파라미터 규모의 서버급 모델

    알리바바 클라우드 공식 문서에는 정식 모델인 qwen3.8-max가 베이징·싱가포르·도쿄·프랑크푸르트·버지니아 지역에 등록돼 있습니다. OpenAI 호환 Chat Completions, Responses API, Anthropic 호환 방식도 제공됩니다.

    프리뷰·정식 모델·오픈웨이트는 서로 다르다

    Qwen3.8-Max 관련 글을 검색할 때 가장 혼동하기 쉬운 부분입니다.

    구분모델 또는 상태의미
    프리뷰qwen3.8-max-preview정식판 출시 전 제공된 테스트 모델
    정식 클라우드 모델qwen3.8-max현재 Model Studio API에서 호출할 수 있는 모델
    오픈웨이트공개 예정모델 가중치를 내려받아 직접 배포할 수 있는 형태
    로컬용 양자화 모델미확인GGUF·AWQ·GPTQ 등 별도 변환본이 필요

    프리뷰 모델은 사고 모드를 항상 사용하는 테스트 모델로 안내됐고, 프리뷰 기간 중 성능이나 동작이 변경될 수 있습니다. 정식 qwen3.8-max는 사고 모드를 켜거나 끌 수 있는 하이브리드 모델로 별도 등록돼 있습니다. 두 모델 ID를 같은 모델로 취급하면 안 됩니다.

    발표일부터 현재까지의 일정

    2026년 7월 19일: 프리뷰 제공

    qwen3.8-max-preview가 Token Plan과 일부 개발 도구에 먼저 추가됐습니다. 이 단계에서는 정식 모델과 공개 가중치가 나오지 않았습니다.

    2026년 8월 2일~3일: 정식 Qwen3.8-Max 발표

    Qwen 공식 페이지에는 8월 2일자로 정식 발표가 게시됐으며, 주요 외신은 8월 3일 출시 소식을 보도했습니다. Qwen 측은 총 2.4조 개의 파라미터 가운데 토큰 처리 시 약 950억 개를 활성화하는 MoE 구조라고 설명했습니다.

    2026년 8월 4일: API 사용 가능, 가중치는 공개 대기

    정식 모델은 Model Studio와 QwenCloud API에서 호출할 수 있습니다. 반면 공식 발표는 가중치가 ‘다음 주’ 공개된다고 안내하고 있어, 현재는 클라우드 모델과 로컬 모델의 상태가 다릅니다.

    Qwen3.8-Max API로 사용하는 방법

    1단계: Model Studio에서 작업 공간과 API 키 만들기

    Alibaba Cloud Model Studio에 가입한 뒤 사용할 지역에 작업 공간을 만들고 API 키를 발급합니다.

    공식 문서에서 확인되는 제공 지역은 다음과 같습니다.

    • 중국 베이징
    • 싱가포르
    • 일본 도쿄
    • 독일 프랑크푸르트
    • 미국 버지니아

    지역마다 Base URL과 API 키가 다르므로, 다른 지역의 주소와 키를 섞어 사용하면 인증 오류가 발생할 수 있습니다.

    2단계: 환경변수 설정

    아래 값에서 API 키와 Base URL은 자신의 Model Studio 작업 공간 정보로 교체합니다.

    export DASHSCOPE_API_KEY="발급받은_API_KEY"
    export QWEN_BASE_URL="https://WorkspaceId.ap-northeast-1.maas.aliyuncs.com/compatible-mode/v1"

    위 Base URL 형식은 일본 도쿄 지역의 예시입니다. WorkspaceId를 실제 작업 공간 ID로 바꿔야 합니다. 다른 지역을 선택했다면 해당 지역 문서에 표시된 주소를 사용합니다.

    3단계: OpenAI 호환 API 호출

    먼저 OpenAI 파이썬 패키지를 설치합니다.

    pip install --upgrade openai

    다음 코드에서 모델 이름은 프리뷰가 아닌 정식 모델인 qwen3.8-max를 사용합니다.

    import os
    
    from openai import OpenAI
    
    api_key = os.getenv("DASHSCOPE_API_KEY")
    base_url = os.getenv("QWEN_BASE_URL")
    
    if not api_key or not base_url:
        raise RuntimeError(
            "DASHSCOPE_API_KEY와 QWEN_BASE_URL 환경변수를 설정해 주세요."
        )
    
    client = OpenAI(
        api_key=api_key,
        base_url=base_url,
    )
    
    response = client.chat.completions.create(
        model="qwen3.8-max",
        messages=[
            {
                "role": "system",
                "content": "정확한 근거와 조건을 구분해서 답변하는 AI 도우미입니다.",
            },
            {
                "role": "user",
                "content": "이 회의록에서 결정 사항과 담당자별 할 일을 표로 정리해 줘.",
            },
        ],
        extra_body={
            "enable_thinking": True,
        },
    )
    
    print(response.choices[0].message.content)

    공식 문서도 OpenAI 호환 클라이언트와 qwen3.8-max 모델 ID를 사용한 호출 예제를 제공합니다. 정식 모델은 사고 모드를 지원하지만, 응답 시간과 토큰 소비를 고려해 단순 작업에서는 사고 모드를 끄는 방식도 검토할 수 있습니다.

    Qwen Code에서 사용하는 방법

    Qwen Code는 터미널에서 프로젝트 파일을 읽고 수정하거나 명령을 실행하는 AI 코딩 도구입니다.

    공식 문서에 따른 기본 흐름은 다음과 같습니다.

    1. Qwen Code를 설치합니다.
    2. 터미널에서 qwen을 실행합니다.
    3. 세션 안에서 /auth를 입력합니다.
    4. Alibaba Cloud Model Studio 인증 방식을 선택합니다.
    5. API 키 또는 지원 요금제를 연결합니다.
    6. 모델 설정에서 qwen3.8-max를 선택합니다.
    qwen
    /auth

    Qwen Code는 종량제, Coding Plan, Token Plan 개인판·팀판과 연결할 수 있습니다. 다만 Token Plan 개인판은 현재 중국 베이징 지역에서만 제공된다고 안내돼 있으므로, 한국에서 사용할 때는 계정과 지역에서 선택 가능한 결제·인증 방식을 먼저 확인해야 합니다.

    Qwen3.8-Max에서 확인된 주요 사양

    항목공식 문서 기준
    구조2.4조 파라미터 MoE
    입력텍스트·이미지·동영상
    출력텍스트
    컨텍스트 길이최대 1,000,000토큰
    최대 출력 길이131,072토큰
    최대 사고 과정 길이262,144토큰
    Function Calling지원
    구조화 출력지원
    컨텍스트 캐시지원
    모델 튜닝현재 미지원
    배치 추론현재 미지원

    지역에 따라 지원 기능이 일부 다릅니다. 예를 들어 공식 모델 문서는 베이징과 싱가포르에서는 웹 검색을 지원하지만, 프랑크푸르트·버지니아·도쿄 항목에는 웹 검색 미지원으로 표시하고 있습니다.

    1백만 토큰을 지원한다고 해서 모든 요청에 긴 원문을 그대로 넣는 것이 유리한 것은 아닙니다. 입력이 길수록 비용과 처리 시간이 늘어나므로, 실제 업무에서는 필요한 문서만 선별하고 반복되는 내용에는 컨텍스트 캐시를 적용하는 편이 적절합니다.

    현재 로컬 실행이 어려운 이유

    가중치 파일이 아직 공개되지 않았다

    API 모델이 출시됐다는 사실과 모델 파일을 다운로드할 수 있다는 사실은 다릅니다.

    Qwen 팀은 Max 계열 모델의 가중치를 처음으로 공개하겠다고 밝혔지만, 발표 시점에는 공개 시기를 다음 주로 안내했습니다. 정확한 배포 날짜, 저장소 주소, 라이선스 조건은 실제 공개 페이지에서 다시 확인해야 합니다.

    2.4조 파라미터 모델은 일반 PC용이 아니다

    Qwen3.8-Max는 전체 2.4조 파라미터 중 요청마다 약 950억 파라미터를 활성화하는 MoE 모델입니다. 일부 파라미터만 활성화하더라도 전체 전문가 가중치를 저장하고 불러올 인프라가 필요하므로, 일반적인 개인용 GPU 한 대에서 실행하는 모델로 보기는 어렵습니다.

    가중치가 공개되더라도 다음 조건을 확인하기 전에는 로컬 설치 명령을 그대로 따라 하면 안 됩니다.

    • 공식 모델 저장소인지
    • 적용 라이선스가 무엇인지
    • 원본·FP8·INT8·4비트 파일 중 어떤 형식인지
    • 필요한 GPU 수와 메모리가 얼마인지
    • vLLM·SGLang·Transformers 지원 버전이 무엇인지
    • 모델 카드에 권장 실행 옵션이 공개됐는지

    특히 ollama pull qwen3.8-max처럼 아직 공식적으로 확인되지 않은 명령은 사용하지 않는 편이 안전합니다.

    Qwen3.8-Max 지금 사용 가능한가를 설명하기 위해 클라우드 API 연결과 공개 대기 중인 로컬 모델 가중치를 대비한 이미지
    Qwen3.8-Max 지금 사용 가능한가를 설명하기 위해 클라우드 API 연결과 공개 대기 중인 로컬 모델 가중치를 대비한 이미지

    어떤 사용 경로를 선택해야 할까?

    목적권장 경로
    모델 성능을 빠르게 시험Model Studio API
    기존 OpenAI API 코드를 최소 수정OpenAI 호환 엔드포인트
    터미널 기반 코딩 작업Qwen Code
    Claude Code와 연결Anthropic 호환 엔드포인트
    회사 문서·영상 분석지역별 Model Studio API와 데이터 정책 검토
    인터넷 연결 없는 환경오픈웨이트와 라이선스 공개 후 검토
    개인 PC 로컬 LLMQwen3.8-Max보다 소형 공개 모델 검토

    간단한 테스트라면 정식 qwen3.8-max API가 가장 명확합니다. 로컬 실행이 목적이라면 성급하게 비공식 변환본을 받기보다 공식 저장소, 모델 카드, 라이선스가 모두 게시될 때까지 기다리는 편이 낫습니다.

    사용 전 체크리스트

    • 모델 ID가 qwen3.8-max인지 확인했다.
    • 프리뷰 모델을 실수로 선택하지 않았다.
    • API 키와 Base URL의 지역이 일치한다.
    • API 키를 코드나 공개 저장소에 직접 넣지 않았다.
    • 월간 또는 일간 사용 한도를 설정했다.
    • 1백만 토큰을 무조건 채워 넣지 않는다.
    • 외부 데이터 전송이 가능한 자료인지 확인했다.
    • 오픈웨이트가 이미 공개됐다고 가정하지 않는다.
    • 벤치마크 수치를 실제 업무 품질 보장으로 해석하지 않는다.

    핵심 정리

    Qwen3.8-Max는 2026년 8월 4일 현재 사용할 수 있습니다. 가장 확실한 방법은 Alibaba Cloud Model Studio에서 qwen3.8-max API를 호출하거나 Qwen Code에 연결하는 것입니다.

    반면 모델 가중치는 아직 공개 예정 상태입니다. 따라서 현재 시점에 Qwen3.8-Max를 Ollama나 LM Studio에 설치하는 공식 절차는 없습니다.

    정리하면 다음과 같습니다.

    클라우드 API 사용은 가능하지만, 공식 로컬 다운로드는 아직 기다려야 합니다.

    자주 묻는 질문

    Qwen3.8-Max는 지금 오픈소스인가요?

    아직 공개가 완료된 상태로 보기는 어렵습니다. Qwen 팀은 가중치 공개 계획을 발표했지만, 검증일 기준 공식 다운로드 파일과 최종 라이선스는 확인되지 않았습니다. ‘오픈웨이트 공개 예정’이라고 표현하는 것이 정확합니다.

    Qwen3.8-Max-Preview와 정식 모델은 같은가요?

    같은 세대에 속하지만 API 모델 ID와 제공 조건이 다릅니다. 프리뷰는 qwen3.8-max-preview, 정식 모델은 qwen3.8-max입니다. 새로 연결한다면 정식 모델 ID를 우선 확인해야 합니다.

    Ollama에서 바로 설치할 수 있나요?

    검증일 기준 공식 Qwen3.8-Max Ollama 모델이나 설치 명령은 확인되지 않았습니다. 공식 가중치와 커뮤니티 양자화 파일이 실제로 공개된 뒤 저장소와 제작자를 확인해야 합니다.

    한국에서도 API를 사용할 수 있나요?

    공식 모델 문서에는 일본 도쿄와 싱가포르를 포함한 여러 지역이 표시돼 있습니다. 실제 사용 가능 지역은 Alibaba Cloud 계정 설정과 생성한 작업 공간에 따라 달라질 수 있습니다.

    1백만 토큰 컨텍스트를 항상 사용할 수 있나요?

    공식 최대 컨텍스트는 1백만 토큰입니다. 다만 최대 입력 길이와 사고 모드 입력 한도는 별도로 정해져 있으며, 긴 입력은 비용과 처리 시간에 영향을 줍니다.

    출처 및 참고자료

    1. Qwen Team, Qwen3.8-Max: A New Bar for Coding and Cowork, 2026년 8월 2일.
    2. Alibaba Cloud Model Studio, qwen3.8-max 모델 정보, 2026년 8월 4일 확인.
    3. Alibaba Cloud Model Studio, 모델 선택 및 지역별 API 엔드포인트, 2026년 8월 4일 확인.
    4. Alibaba Cloud Model Studio, Qwen Code 연결 안내, 2026년 8월 4일 확인.
    5. Reuters, Alibaba unveils its largest AI model yet, 2026년 8월 3일.
    6. South China Morning Post, Qwen3.8-Max widely accessible ahead of open-weights release, 2026년 8월 3일.
    7. The Verge, China’s Alibaba takes another swipe at America’s AI supremacy, 2026년 8월 3일.
  • Kimi K3 로컬 실행 가능할까? GPU·메모리 요구량과 API 대안

    Kimi K3 로컬 실행 가능할까? GPU·메모리 요구량과 API 대안

    Kimi K3 로컬 실행은 기술적으로 가능하지만, 일반적인 개인용 PC나 단일 GPU 워크스테이션에서 전체 모델을 실용적으로 구동하기는 어렵습니다.

    공식 가중치 저장소의 전체 용량이 약 1.56TB이고, 현재 공개된 vLLM 배포 레시피도 최소 GB300 GPU 8개를 전제로 합니다. 일반 사용자가 말하는 ‘내 컴퓨터에서 실행’보다는 여러 가속기를 연결한 서버에서 자체 호스팅하는 모델에 가깝습니다.

    다만 594GB까지 줄인 비공식 1비트 GGUF 양자화가 등장해, 대용량 시스템 메모리를 갖춘 특수 장비에서는 실험적인 CPU·GPU 혼합 실행이 가능해졌습니다. 모델을 불러오는 것과 대화형 속도로 안정적으로 운영하는 것은 별개의 문제입니다.

    Kimi K3 로컬 실행 결론부터 정리

    사용 환경실행 가능성현실적인 판단
    일반 노트북·데스크톱사실상 불가저장공간과 메모리가 부족함
    24~96GB GPU 워크스테이션전체 모델 불가모델 가중치가 GPU 메모리를 크게 초과
    512GB 시스템 RAM1비트 양자화도 부족가장 작은 공개 GGUF가 594GB이며 실행 여유 공간도 필요
    768GB~1TB급 RAM 서버실험 가능성 있음1비트 양자화와 CPU 오프로딩은 가능하지만 속도·품질 검증 필요
    GB300 8개 이상 서버공식 배포 경로 존재vLLM이 제시한 현재 최소 배포 구성
    B200·H200·H100 다중 노드가능SGLang의 하드웨어별 배포 레시피 사용
    Kimi API가장 간단하드웨어 구축 없이 원격 모델 사용

    개인 PC에서 Kimi K3의 전체 가중치를 직접 실행하려는 목적이라면 현실적인 답은 아니오에 가깝습니다. 회사 서버나 GPU 클러스터를 보유했거나, 초저비트 양자화를 낮은 속도로 시험하려는 경우에만 자체 실행을 검토할 만합니다.

    Kimi K3가 얼마나 큰 모델인가

    Moonshot AI가 공개한 Kimi K3의 핵심 사양은 다음과 같습니다.

    항목공식 사양
    전체 매개변수2.8조 개
    토큰당 활성 매개변수1,040억 개
    구조Mixture-of-Experts
    전체 전문가 수896개
    토큰당 선택 전문가16개
    최대 컨텍스트1,048,576토큰
    공식 가중치 형식MXFP4
    공식 저장소 용량약 1.56TB
    가중치 파일Safetensors 96개 조각

    Kimi K3는 각 토큰을 처리할 때 896개 전문가 중 16개만 선택하는 희소 MoE 구조입니다. 활성 매개변수는 1,040억 개지만, 이것이 곧 “1,040억 모델과 같은 메모리로 실행된다”는 뜻은 아닙니다. 요청마다 서로 다른 전문가가 선택될 수 있으므로 전체 전문가 가중치를 저장하거나 필요한 시점에 빠르게 불러올 수 있어야 합니다.

    활성 매개변수와 필요한 메모리는 다르다

    MoE 모델에서는 세 가지 수치를 구분해야 합니다.

    1. 전체 매개변수: 저장해야 하는 전체 모델 규모
    2. 활성 매개변수: 한 토큰 계산에 실제 참여하는 부분
    3. 실행 메모리: 가중치와 KV 캐시, KDA 상태, 버퍼, 추론 엔진이 차지하는 전체 용량

    Kimi K3는 계산할 때 전체 2.8조 개를 매번 사용하지 않지만, 전체 가중치 저장소는 여전히 약 1.56TB입니다. 여기에 컨텍스트 캐시와 추론 엔진용 메모리가 추가되기 때문에 1.56TB의 GPU 메모리나 RAM만 확보했다고 바로 안정적인 실행이 보장되지는 않습니다.

    공식 Kimi K3 GPU 요구사항

    Moonshot AI는 Kimi K3의 효율적인 추론 환경으로 64개 이상의 가속기를 연결한 슈퍼노드 구성을 권장했습니다. 이는 모델을 켤 수 있는 절대적인 최소 사양이 아니라, 대규모 서비스에서 통신 효율과 처리량을 확보하기 위한 권장 환경입니다.

    현재 vLLM과 SGLang이 공개한 실제 배포 예시는 다음과 같습니다.

    추론 엔진공개된 구성 예시성격
    vLLMGB300 8개 이상현재 공개된 최소 하드웨어 안내
    vLLM ROCmMI350X·MI355X 8개 이상AMD 가속기 경로
    SGLangB300 8개단일 노드 구성
    SGLangGB300 8개4개 GPU 노드 2대
    SGLangB200·GB200 16개파이프라인 병렬 구성
    SGLangH200 16~32개처리량 설정에 따라 달라짐
    SGLangH100 32개다중 노드 구성

    vLLM의 Kimi K3 레시피는 CUDA 13 기반 이미지와 최신 NVIDIA 드라이버를 요구하며, 실제 서비스 트래픽에는 다중 노드 구성을 권장합니다. SGLang도 B300·GB300·B200·GB200·H200·H100·MI350X 계열별로 별도의 병렬화 설정을 제공합니다.

    따라서 “Kimi K3는 GPU 몇 장이면 실행되는가?”라는 질문에는 GPU 개수만으로 답하기 어렵습니다. GPU 종류와 메모리 용량, 노드 간 연결 속도, 컨텍스트 길이, 동시 요청 수, 목표 응답 속도를 함께 정해야 합니다.

    1.56TB는 저장공간일 뿐이다

    Hugging Face의 공식 Kimi K3 저장소는 약 1.56TB이며, 가중치가 96개의 Safetensors 파일로 나뉘어 있습니다. 최소한 이 파일을 내려받을 저장공간이 필요합니다.

    실행할 때는 다음 공간이 추가됩니다.

    • 모델 가중치를 올려 둘 GPU 메모리 또는 시스템 RAM
    • 입력과 출력 토큰을 보관하는 캐시
    • KDA 상태 메모리
    • 이미지 인코더와 추론 엔진의 작업 공간
    • 동시 요청 처리를 위한 여유 메모리
    • 모델 다운로드·변환·캐시용 디스크 공간

    특히 최대 100만 토큰 컨텍스트는 모델이 지원하는 상한선이지, 모든 환경에서 부담 없이 사용할 수 있다는 의미가 아닙니다. SGLang의 저메모리 프로필도 메모리 여유를 확보하기 위해 컨텍스트를 65,536토큰으로 줄이고 동시 요청 수를 제한합니다.

    GGUF 양자화를 사용하면 개인 PC에서 가능할까

    Unsloth가 공개한 Kimi K3 GGUF 양자화 파일 크기는 다음과 같습니다.

    양자화공개 파일 크기해석
    UD-IQ1_S594GB가장 작은 공개 변형
    UD-IQ1_M649GB1비트 계열
    UD-IQ2_XXS711GB2비트 계열
    UD-Q2_K_XL861GB고품질 2비트 계열
    UD-Q4_K_XL1.51TB원본과 크기 차이가 작음
    UD-Q8_K_XL1.56TB사실상 원본 저장소와 유사

    Kimi K3는 처음부터 MXFP4 가중치로 학습됐기 때문에, 일반적인 BF16 모델처럼 Q4로 바꿨을 때 파일 크기가 절반 이하로 크게 줄어들지 않습니다. Unsloth 자료에서도 Q4가 1.51TB, Q8이 1.56TB로 표시됩니다.

    594GB 모델은 512GB RAM에서 실행될까

    파일 크기만 놓고 보면 어렵습니다. 594GB는 가중치 파일 자체의 크기이며, 운영체제와 추론 프로그램, 모델 상태, 컨텍스트 캐시가 사용할 공간이 별도로 필요합니다.

    768GB나 1TB급 시스템 RAM에서는 1비트 모델을 불러올 여지가 생기지만 다음 문제가 남습니다.

    • CPU 메모리 대역폭에 따른 느린 생성 속도
    • 디스크 오프로딩 시 추가 속도 저하
    • 초저비트 양자화에 따른 응답 품질 변화
    • 멀티모달 기능과 긴 컨텍스트의 제약
    • llama.cpp용 Kimi K3 지원 코드의 성숙도
    • 장시간 실행 시 안정성

    Unsloth는 llama.cpp와 Unsloth Studio를 이용한 실행 경로를 제공하지만, 이는 Moonshot AI의 공식 프로덕션 배포 구성과는 다릅니다. 개인 실험용 경로로 보는 편이 안전합니다.

    공식 가중치와 GGUF 중 무엇을 선택해야 하나

    공식 MXFP4 가중치가 적합한 경우

    • 데이터센터급 GPU 클러스터를 보유함
    • vLLM이나 SGLang으로 API 서버를 구축하려 함
    • 정확도와 원본 동작 보존이 중요함
    • 다중 사용자 요청을 처리해야 함
    • 이미지 입력과 긴 컨텍스트를 활용해야 함

    공식 모델 카드는 vLLM, SGLang, TokenSpeed를 권장 추론 엔진으로 안내합니다.

    GGUF가 적합한 경우

    • 초대용량 RAM 서버에서 개인 실험을 진행함
    • GPU 전체 상주 대신 CPU·GPU 혼합 실행을 시험함
    • 낮은 속도를 감수할 수 있음
    • 양자화에 따른 품질 변화를 직접 평가할 수 있음
    • 프로덕션이 아닌 기술 검증이 목적임

    GGUF 파일이 존재한다고 해서 노트북용 모델이 된 것은 아닙니다. 가장 작은 변형도 594GB이므로, 일반 로컬 LLM과 같은 설치 경험을 기대하기 어렵습니다.

    Kimi K3 실행 환경을 개인용 데스크톱과 다중 GPU 데이터센터 서버로 비교한 이미지
    Kimi K3 실행 환경을 개인용 데스크톱과 다중 GPU 데이터센터 서버로 비교한 이미지

    직접 실행과 API 사용 비교

    기준자체 호스팅Kimi API
    초기 구축GPU 서버와 네트워크 필요API 키와 결제 설정
    데이터 통제자체 인프라 안에서 관리 가능외부 서비스 전송 조건 확인 필요
    운영 난이도매우 높음낮음
    업데이트직접 모델·엔진 업데이트제공사가 관리
    긴 컨텍스트메모리 예산에 따라 제한서비스 제공 범위에서 사용
    비용 구조장비·전력·운영 인력토큰 사용량 기준
    적합한 대상연구기관·인프라 조직개인 개발자·일반 기업

    2026년 8월 3일 확인 기준 Kimi의 공식 글로벌 가격 안내에는 캐시가 적용되지 않은 입력이 100만 토큰당 3달러, 출력이 15달러, 캐시 적중 입력이 0.30달러로 표시돼 있습니다. 가격과 사용 가능 지역은 바뀔 수 있으므로 실제 적용 전 공식 결제 화면을 다시 확인해야 합니다.

    모델 성능을 확인하거나 코딩 에이전트에 연결하는 것이 목적이라면 API가 훨씬 현실적입니다. 자체 호스팅은 외부 전송이 허용되지 않는 데이터, 고정된 내부 인프라 정책, 대규모·지속적인 호출량처럼 명확한 이유가 있을 때 검토할 수 있습니다.

    ‘Kimi Code를 로컬에서 실행’하는 것과 다른 점

    터미널에 Kimi Code CLI를 설치해 사용하는 것은 프로그램이 내 컴퓨터에서 실행된다는 뜻입니다. 그러나 기본 설정에서 Kimi K3의 1.56TB 가중치가 내 PC에 적재되는 것은 아닙니다. CLI가 원격 Kimi 모델을 호출하는 방식과 모델 자체를 서버에 배포하는 자체 호스팅은 구분해야 합니다.

    로컬 실행이라는 표현은 다음 세 가지 의미로 사용됩니다.

    1. 로컬 클라이언트: 내 PC의 프로그램이 클라우드 API를 호출
    2. 자체 호스팅: 회사나 개인이 관리하는 GPU 서버에서 전체 가중치 실행
    3. 양자화 실험: GGUF와 CPU·GPU 오프로딩으로 축소 모델 실행

    Kimi K3의 전체 가중치를 내 장비에서 돌리는지는 두 번째와 세 번째 경우에만 해당합니다.

    자체 호스팅 전 확인할 체크리스트

    하드웨어

    • 모델 파일을 보관할 디스크가 2TB 이상인가
    • 가중치와 실행 여유 공간을 감당할 HBM 또는 RAM이 있는가
    • GPU 간 NVLink·RDMA 등 고속 연결을 사용할 수 있는가
    • vLLM·SGLang이 지원하는 GPU와 드라이버 조합인가
    • 장시간 부하에 필요한 전력과 냉각이 준비됐는가

    실행 조건

    • 최대 컨텍스트가 정말 100만 토큰이어야 하는가
    • 예상 동시 요청 수를 정했는가
    • 목표 첫 토큰 지연 시간과 생성 속도를 정했는가
    • 이미지 입력이 필요한가
    • 원본 MXFP4와 GGUF 중 어떤 형식을 사용할지 정했는가

    운영

    • 모델 라이선스를 확인했는가
    • 입력 데이터와 로그 보존 정책을 정했는가
    • 엔진 업데이트와 보안 패치를 담당할 인력이 있는가
    • 자체 구축비와 API 비용을 같은 사용량 기준으로 비교했는가
    • 장애 시 대체 API나 모델을 준비했는가

    어떤 선택이 현실적인가

    개인 사용자

    일반 PC에서 Kimi K3 전체 모델을 직접 실행하기보다 Kimi 웹 서비스나 API를 사용하는 편이 현실적입니다. 로컬 처리가 꼭 필요하다면 Kimi K3가 아닌 더 작은 모델을 선택하는 것이 합리적입니다.

    개발팀

    짧은 평가 기간에는 API를 사용해 성능과 토큰 사용량을 먼저 측정하는 편이 낫습니다. 이후 데이터 반출 제한이나 지속적인 대규모 호출 때문에 자체 호스팅의 이점이 확인될 때 클러스터 구축을 검토할 수 있습니다.

    연구기관·인프라 조직

    GB300·B300·H200·H100·MI350X 계열의 다중 GPU 환경이 있다면 vLLM이나 SGLang의 공식 레시피를 기준으로 시험할 수 있습니다. 처음부터 100만 토큰과 높은 동시성을 적용하기보다 짧은 컨텍스트와 낮은 동시 요청으로 시작해 메모리와 처리량을 측정해야 합니다.

    핵심 요약

    • Kimi K3는 2.8조 매개변수, 활성 1,040억 매개변수의 MoE 모델입니다.
    • 공식 가중치 저장소는 약 1.56TB입니다.
    • 활성 매개변수가 작아도 전체 전문가 가중치를 저장하거나 읽을 수 있어야 합니다.
    • vLLM이 안내하는 현재 최소 공식 구성은 GB300 GPU 8개 이상입니다.
    • SGLang은 GPU 종류에 따라 8~32개 이상의 배포 구성을 제공합니다.
    • 가장 작은 공개 GGUF도 594GB여서 일반 PC용 모델로 보기 어렵습니다.
    • 개인 사용자와 소규모 개발팀에는 API 방식이 가장 현실적입니다.
    • 자체 호스팅은 데이터 통제나 대규모 사용량처럼 분명한 운영 이유가 있을 때 검토해야 합니다.

    FAQ

    Kimi K3를 맥북이나 윈도우 노트북에서 실행할 수 있나요?

    전체 모델을 실용적인 속도로 실행하기는 어렵습니다. 가장 작은 공개 GGUF도 594GB이며, 일반 노트북의 통합 메모리나 RAM을 크게 초과합니다. 원격 API를 호출하는 클라이언트 프로그램은 노트북에서도 사용할 수 있지만, 이는 모델 가중치 자체를 로컬에서 실행하는 것과 다릅니다.

    활성 매개변수가 104B라면 104B 모델용 GPU로 충분하지 않나요?

    아닙니다. 104B는 한 토큰을 계산할 때 활성화되는 매개변수 규모입니다. 라우터가 요청마다 다른 전문가를 선택할 수 있으므로 전체 2.8T 가중치에 접근할 수 있어야 합니다.

    594GB 1비트 모델은 품질이 원본과 같나요?

    같다고 단정할 수 없습니다. 594GB 변형은 제3자가 만든 초저비트 GGUF이며, Moonshot AI의 공식 MXFP4 체크포인트와 형식과 정밀도가 다릅니다. 사용 목적에 맞는 별도 품질 평가가 필요합니다.

    100만 토큰 컨텍스트를 로컬에서도 바로 사용할 수 있나요?

    모델이 지원하는 최대 상한은 1,048,576토큰이지만, 실제 사용 가능한 길이는 GPU 메모리와 동시 요청 수에 따라 달라집니다. SGLang의 저메모리 예시도 컨텍스트를 65,536토큰으로 낮춰 메모리를 확보합니다.

    자체 호스팅과 API 중 어느 쪽이 더 저렴한가요?

    호출량과 장비 보유 여부에 따라 달라집니다. 자체 호스팅에는 GPU 구매·임대, 전력, 네트워크, 저장장치, 엔지니어링 비용이 포함됩니다. 사용량이 확정되지 않은 초기 단계에서는 API로 실제 토큰 사용량을 측정한 뒤 비교하는 방식이 안전합니다.

    출처 및 참고자료

    1. Moonshot AI, Kimi K3 공식 GitHub 저장소 — 모델 구조와 전체·활성 매개변수, 공개 가중치 안내. 확인일 2026-08-03.
    2. Moonshot AI, Kimi K3 공식 Hugging Face 모델 카드 — MXFP4 형식, 100만 토큰 컨텍스트, 배포 엔진 안내. 확인일 2026-08-03.
    3. Moonshot AI, Kimi K3 기술 소개 — 64개 이상 가속기 슈퍼노드 권장과 아키텍처 설명. 2026-07-14.
    4. vLLM, Kimi K3 배포 레시피 — GB300·MI350X 계열의 최소 배포 안내. 업데이트 2026-07-30.
    5. SGLang, Kimi K3 Cookbook — B300·GB300·B200·H200·H100별 다중 GPU 구성. 확인일 2026-08-03.
    6. Unsloth, Kimi K3 GGUF — 1비트·2비트·4비트·8비트 양자화 파일 크기와 llama.cpp 실행 경로. 확인일 2026-08-03.
    7. Kimi 공식 가격 안내 — Kimi K3 API 입력·출력 가격과 컨텍스트 길이. 2026-07-28.