[태그:] 알리바바 클라우드

  • Qwen3.8-Max는 지금 쓸 수 있을까? API 사용 경로와 오픈웨이트 공개 일정

    Qwen3.8-Max는 지금 쓸 수 있을까? API 사용 경로와 오픈웨이트 공개 일정

    2026년 8월 4일 기준, Qwen3.8-Max는 지금 사용할 수 있습니다. 다만 현재 가능한 방식은 알리바바 클라우드의 API나 Qwen Code 같은 클라우드 연결 방식입니다.

    모델 파일을 내려받아 Ollama나 LM Studio로 실행하는 것은 아직 어렵습니다. Qwen 팀은 Qwen3.8-Max의 가중치를 다음 주에 공개하겠다고 발표했지만, 현재 확인되는 공식 자료에는 다운로드 주소와 최종 라이선스가 나오지 않았습니다.

    Qwen3.8-Max 현재 사용 가능 여부

    사용 방법현재 가능 여부확인할 사항
    Alibaba Cloud Model Studio API가능모델 ID는 qwen3.8-max
    OpenAI 호환 API가능지역별 Base URL과 Workspace ID 필요
    Anthropic 호환 API가능Claude Code 등과 연결 가능
    Qwen Code가능Model Studio API 키 또는 지원 요금제 필요
    Qwen3.8-Max-Preview가능정식판과 별도 모델이므로 혼동 주의
    Hugging Face·ModelScope에서 가중치 다운로드아직 공개 전다음 주 공개 예고
    Ollama·LM Studio 로컬 실행현재 불가공식 가중치와 변환 파일이 공개된 뒤 확인
    일반 PC에서 Qwen3.8-Max 전체 모델 실행현실적으로 어려울 가능성이 큼2.4조 파라미터 규모의 서버급 모델

    알리바바 클라우드 공식 문서에는 정식 모델인 qwen3.8-max가 베이징·싱가포르·도쿄·프랑크푸르트·버지니아 지역에 등록돼 있습니다. OpenAI 호환 Chat Completions, Responses API, Anthropic 호환 방식도 제공됩니다.

    프리뷰·정식 모델·오픈웨이트는 서로 다르다

    Qwen3.8-Max 관련 글을 검색할 때 가장 혼동하기 쉬운 부분입니다.

    구분모델 또는 상태의미
    프리뷰qwen3.8-max-preview정식판 출시 전 제공된 테스트 모델
    정식 클라우드 모델qwen3.8-max현재 Model Studio API에서 호출할 수 있는 모델
    오픈웨이트공개 예정모델 가중치를 내려받아 직접 배포할 수 있는 형태
    로컬용 양자화 모델미확인GGUF·AWQ·GPTQ 등 별도 변환본이 필요

    프리뷰 모델은 사고 모드를 항상 사용하는 테스트 모델로 안내됐고, 프리뷰 기간 중 성능이나 동작이 변경될 수 있습니다. 정식 qwen3.8-max는 사고 모드를 켜거나 끌 수 있는 하이브리드 모델로 별도 등록돼 있습니다. 두 모델 ID를 같은 모델로 취급하면 안 됩니다.

    발표일부터 현재까지의 일정

    2026년 7월 19일: 프리뷰 제공

    qwen3.8-max-preview가 Token Plan과 일부 개발 도구에 먼저 추가됐습니다. 이 단계에서는 정식 모델과 공개 가중치가 나오지 않았습니다.

    2026년 8월 2일~3일: 정식 Qwen3.8-Max 발표

    Qwen 공식 페이지에는 8월 2일자로 정식 발표가 게시됐으며, 주요 외신은 8월 3일 출시 소식을 보도했습니다. Qwen 측은 총 2.4조 개의 파라미터 가운데 토큰 처리 시 약 950억 개를 활성화하는 MoE 구조라고 설명했습니다.

    2026년 8월 4일: API 사용 가능, 가중치는 공개 대기

    정식 모델은 Model Studio와 QwenCloud API에서 호출할 수 있습니다. 반면 공식 발표는 가중치가 ‘다음 주’ 공개된다고 안내하고 있어, 현재는 클라우드 모델과 로컬 모델의 상태가 다릅니다.

    Qwen3.8-Max API로 사용하는 방법

    1단계: Model Studio에서 작업 공간과 API 키 만들기

    Alibaba Cloud Model Studio에 가입한 뒤 사용할 지역에 작업 공간을 만들고 API 키를 발급합니다.

    공식 문서에서 확인되는 제공 지역은 다음과 같습니다.

    • 중국 베이징
    • 싱가포르
    • 일본 도쿄
    • 독일 프랑크푸르트
    • 미국 버지니아

    지역마다 Base URL과 API 키가 다르므로, 다른 지역의 주소와 키를 섞어 사용하면 인증 오류가 발생할 수 있습니다.

    2단계: 환경변수 설정

    아래 값에서 API 키와 Base URL은 자신의 Model Studio 작업 공간 정보로 교체합니다.

    export DASHSCOPE_API_KEY="발급받은_API_KEY"
    export QWEN_BASE_URL="https://WorkspaceId.ap-northeast-1.maas.aliyuncs.com/compatible-mode/v1"

    위 Base URL 형식은 일본 도쿄 지역의 예시입니다. WorkspaceId를 실제 작업 공간 ID로 바꿔야 합니다. 다른 지역을 선택했다면 해당 지역 문서에 표시된 주소를 사용합니다.

    3단계: OpenAI 호환 API 호출

    먼저 OpenAI 파이썬 패키지를 설치합니다.

    pip install --upgrade openai

    다음 코드에서 모델 이름은 프리뷰가 아닌 정식 모델인 qwen3.8-max를 사용합니다.

    import os
    
    from openai import OpenAI
    
    api_key = os.getenv("DASHSCOPE_API_KEY")
    base_url = os.getenv("QWEN_BASE_URL")
    
    if not api_key or not base_url:
        raise RuntimeError(
            "DASHSCOPE_API_KEY와 QWEN_BASE_URL 환경변수를 설정해 주세요."
        )
    
    client = OpenAI(
        api_key=api_key,
        base_url=base_url,
    )
    
    response = client.chat.completions.create(
        model="qwen3.8-max",
        messages=[
            {
                "role": "system",
                "content": "정확한 근거와 조건을 구분해서 답변하는 AI 도우미입니다.",
            },
            {
                "role": "user",
                "content": "이 회의록에서 결정 사항과 담당자별 할 일을 표로 정리해 줘.",
            },
        ],
        extra_body={
            "enable_thinking": True,
        },
    )
    
    print(response.choices[0].message.content)

    공식 문서도 OpenAI 호환 클라이언트와 qwen3.8-max 모델 ID를 사용한 호출 예제를 제공합니다. 정식 모델은 사고 모드를 지원하지만, 응답 시간과 토큰 소비를 고려해 단순 작업에서는 사고 모드를 끄는 방식도 검토할 수 있습니다.

    Qwen Code에서 사용하는 방법

    Qwen Code는 터미널에서 프로젝트 파일을 읽고 수정하거나 명령을 실행하는 AI 코딩 도구입니다.

    공식 문서에 따른 기본 흐름은 다음과 같습니다.

    1. Qwen Code를 설치합니다.
    2. 터미널에서 qwen을 실행합니다.
    3. 세션 안에서 /auth를 입력합니다.
    4. Alibaba Cloud Model Studio 인증 방식을 선택합니다.
    5. API 키 또는 지원 요금제를 연결합니다.
    6. 모델 설정에서 qwen3.8-max를 선택합니다.
    qwen
    /auth

    Qwen Code는 종량제, Coding Plan, Token Plan 개인판·팀판과 연결할 수 있습니다. 다만 Token Plan 개인판은 현재 중국 베이징 지역에서만 제공된다고 안내돼 있으므로, 한국에서 사용할 때는 계정과 지역에서 선택 가능한 결제·인증 방식을 먼저 확인해야 합니다.

    Qwen3.8-Max에서 확인된 주요 사양

    항목공식 문서 기준
    구조2.4조 파라미터 MoE
    입력텍스트·이미지·동영상
    출력텍스트
    컨텍스트 길이최대 1,000,000토큰
    최대 출력 길이131,072토큰
    최대 사고 과정 길이262,144토큰
    Function Calling지원
    구조화 출력지원
    컨텍스트 캐시지원
    모델 튜닝현재 미지원
    배치 추론현재 미지원

    지역에 따라 지원 기능이 일부 다릅니다. 예를 들어 공식 모델 문서는 베이징과 싱가포르에서는 웹 검색을 지원하지만, 프랑크푸르트·버지니아·도쿄 항목에는 웹 검색 미지원으로 표시하고 있습니다.

    1백만 토큰을 지원한다고 해서 모든 요청에 긴 원문을 그대로 넣는 것이 유리한 것은 아닙니다. 입력이 길수록 비용과 처리 시간이 늘어나므로, 실제 업무에서는 필요한 문서만 선별하고 반복되는 내용에는 컨텍스트 캐시를 적용하는 편이 적절합니다.

    현재 로컬 실행이 어려운 이유

    가중치 파일이 아직 공개되지 않았다

    API 모델이 출시됐다는 사실과 모델 파일을 다운로드할 수 있다는 사실은 다릅니다.

    Qwen 팀은 Max 계열 모델의 가중치를 처음으로 공개하겠다고 밝혔지만, 발표 시점에는 공개 시기를 다음 주로 안내했습니다. 정확한 배포 날짜, 저장소 주소, 라이선스 조건은 실제 공개 페이지에서 다시 확인해야 합니다.

    2.4조 파라미터 모델은 일반 PC용이 아니다

    Qwen3.8-Max는 전체 2.4조 파라미터 중 요청마다 약 950억 파라미터를 활성화하는 MoE 모델입니다. 일부 파라미터만 활성화하더라도 전체 전문가 가중치를 저장하고 불러올 인프라가 필요하므로, 일반적인 개인용 GPU 한 대에서 실행하는 모델로 보기는 어렵습니다.

    가중치가 공개되더라도 다음 조건을 확인하기 전에는 로컬 설치 명령을 그대로 따라 하면 안 됩니다.

    • 공식 모델 저장소인지
    • 적용 라이선스가 무엇인지
    • 원본·FP8·INT8·4비트 파일 중 어떤 형식인지
    • 필요한 GPU 수와 메모리가 얼마인지
    • vLLM·SGLang·Transformers 지원 버전이 무엇인지
    • 모델 카드에 권장 실행 옵션이 공개됐는지

    특히 ollama pull qwen3.8-max처럼 아직 공식적으로 확인되지 않은 명령은 사용하지 않는 편이 안전합니다.

    Qwen3.8-Max 지금 사용 가능한가를 설명하기 위해 클라우드 API 연결과 공개 대기 중인 로컬 모델 가중치를 대비한 이미지
    Qwen3.8-Max 지금 사용 가능한가를 설명하기 위해 클라우드 API 연결과 공개 대기 중인 로컬 모델 가중치를 대비한 이미지

    어떤 사용 경로를 선택해야 할까?

    목적권장 경로
    모델 성능을 빠르게 시험Model Studio API
    기존 OpenAI API 코드를 최소 수정OpenAI 호환 엔드포인트
    터미널 기반 코딩 작업Qwen Code
    Claude Code와 연결Anthropic 호환 엔드포인트
    회사 문서·영상 분석지역별 Model Studio API와 데이터 정책 검토
    인터넷 연결 없는 환경오픈웨이트와 라이선스 공개 후 검토
    개인 PC 로컬 LLMQwen3.8-Max보다 소형 공개 모델 검토

    간단한 테스트라면 정식 qwen3.8-max API가 가장 명확합니다. 로컬 실행이 목적이라면 성급하게 비공식 변환본을 받기보다 공식 저장소, 모델 카드, 라이선스가 모두 게시될 때까지 기다리는 편이 낫습니다.

    사용 전 체크리스트

    • 모델 ID가 qwen3.8-max인지 확인했다.
    • 프리뷰 모델을 실수로 선택하지 않았다.
    • API 키와 Base URL의 지역이 일치한다.
    • API 키를 코드나 공개 저장소에 직접 넣지 않았다.
    • 월간 또는 일간 사용 한도를 설정했다.
    • 1백만 토큰을 무조건 채워 넣지 않는다.
    • 외부 데이터 전송이 가능한 자료인지 확인했다.
    • 오픈웨이트가 이미 공개됐다고 가정하지 않는다.
    • 벤치마크 수치를 실제 업무 품질 보장으로 해석하지 않는다.

    핵심 정리

    Qwen3.8-Max는 2026년 8월 4일 현재 사용할 수 있습니다. 가장 확실한 방법은 Alibaba Cloud Model Studio에서 qwen3.8-max API를 호출하거나 Qwen Code에 연결하는 것입니다.

    반면 모델 가중치는 아직 공개 예정 상태입니다. 따라서 현재 시점에 Qwen3.8-Max를 Ollama나 LM Studio에 설치하는 공식 절차는 없습니다.

    정리하면 다음과 같습니다.

    클라우드 API 사용은 가능하지만, 공식 로컬 다운로드는 아직 기다려야 합니다.

    자주 묻는 질문

    Qwen3.8-Max는 지금 오픈소스인가요?

    아직 공개가 완료된 상태로 보기는 어렵습니다. Qwen 팀은 가중치 공개 계획을 발표했지만, 검증일 기준 공식 다운로드 파일과 최종 라이선스는 확인되지 않았습니다. ‘오픈웨이트 공개 예정’이라고 표현하는 것이 정확합니다.

    Qwen3.8-Max-Preview와 정식 모델은 같은가요?

    같은 세대에 속하지만 API 모델 ID와 제공 조건이 다릅니다. 프리뷰는 qwen3.8-max-preview, 정식 모델은 qwen3.8-max입니다. 새로 연결한다면 정식 모델 ID를 우선 확인해야 합니다.

    Ollama에서 바로 설치할 수 있나요?

    검증일 기준 공식 Qwen3.8-Max Ollama 모델이나 설치 명령은 확인되지 않았습니다. 공식 가중치와 커뮤니티 양자화 파일이 실제로 공개된 뒤 저장소와 제작자를 확인해야 합니다.

    한국에서도 API를 사용할 수 있나요?

    공식 모델 문서에는 일본 도쿄와 싱가포르를 포함한 여러 지역이 표시돼 있습니다. 실제 사용 가능 지역은 Alibaba Cloud 계정 설정과 생성한 작업 공간에 따라 달라질 수 있습니다.

    1백만 토큰 컨텍스트를 항상 사용할 수 있나요?

    공식 최대 컨텍스트는 1백만 토큰입니다. 다만 최대 입력 길이와 사고 모드 입력 한도는 별도로 정해져 있으며, 긴 입력은 비용과 처리 시간에 영향을 줍니다.

    출처 및 참고자료

    1. Qwen Team, Qwen3.8-Max: A New Bar for Coding and Cowork, 2026년 8월 2일.
    2. Alibaba Cloud Model Studio, qwen3.8-max 모델 정보, 2026년 8월 4일 확인.
    3. Alibaba Cloud Model Studio, 모델 선택 및 지역별 API 엔드포인트, 2026년 8월 4일 확인.
    4. Alibaba Cloud Model Studio, Qwen Code 연결 안내, 2026년 8월 4일 확인.
    5. Reuters, Alibaba unveils its largest AI model yet, 2026년 8월 3일.
    6. South China Morning Post, Qwen3.8-Max widely accessible ahead of open-weights release, 2026년 8월 3일.
    7. The Verge, China’s Alibaba takes another swipe at America’s AI supremacy, 2026년 8월 3일.