[태그:] LLM

  • Grok 4.6 vs GPT-5.6 Sol 비교: 가격·속도·장문 작업에서 무엇이 유리할까

    Grok 4.6 vs GPT-5.6 Sol 비교: 가격·속도·장문 작업에서 무엇이 유리할까

    Grok 4.6과 GPT-5.6 Sol 중 하나를 고른다면 기준은 꽤 분명합니다. API 비용과 출력량이 중요하면 Grok 4.6이 유리합니다. 반대로 한 요청에 50만 토큰을 넘는 대용량 문서를 넣거나 긴 컨텍스트를 유지해야 한다면 GPT-5.6 Sol 쪽이 낫습니다.

    코딩 성능은 어느 한쪽의 완승이라고 보기 어렵습니다. Grok 4.6은 CursorBench에서 강했고, GPT-5.6 Sol은 DeepSWE와 터미널 작업 평가에서 앞섰습니다. 따라서 “벤치마크 1등 모델”을 찾기보다 내 작업이 코드 수정 중심인지, 터미널·장기 에이전트 중심인지, 대용량 문서 중심인지 구분하는 편이 실용적입니다.

    먼저 결론부터: 어떤 경우에 무엇을 고를까

    사용 목적더 유리한 선택이유
    API 비용을 최대한 낮추고 싶을 때Grok 4.6기본 입력 $2, 출력 $6/100만 토큰
    출력 토큰이 많이 발생하는 에이전트Grok 4.6GPT-5.6 Sol보다 출력 단가 차이가 큼
    50만 토큰 이상의 자료를 한 번에 처리GPT-5.6 Sol105만 토큰 컨텍스트 지원
    여러 파일을 수정하는 코딩 에이전트Grok 4.6도 강함CursorBench 3.2에서 높은 점수
    터미널·장기 소프트웨어 작업GPT-5.6 Sol 우세 구간 존재DeepSWE·Terminal-Bench에서 우위
    첫 응답 지연시간이 중요한 서비스실제 환경 테스트 필요reasoning 설정과 처리 모드에 따라 크게 달라짐
    비용과 성능을 함께 따질 때둘 다 샘플 테스트벤치마크마다 우위가 달라짐

    Grok 4.6과 GPT-5.6 Sol 가격부터 비교하면

    SpaceXAI가 2026년 8월 12일 공개한 Grok 4.6은 코딩, 장시간 에이전트, 지식 작업을 주요 용도로 내세운 모델입니다. 기본 API 가격은 100만 토큰당 입력 2달러, 캐시 입력 0.50달러, 출력 6달러입니다. 컨텍스트 창은 50만 토큰입니다.

    GPT-5.6 Sol은 OpenAI의 GPT-5.6 계열 최상위 모델로, API 기준 컨텍스트 창이 105만 토큰이며 최대 출력은 12만8천 토큰입니다. 기본 가격은 입력 5달러, 캐시 입력 0.50달러, 출력 30달러입니다.

    항목Grok 4.6GPT-5.6 Sol
    기본 입력 100만 토큰$2$5
    캐시 입력 100만 토큰$0.50$0.50
    기본 출력 100만 토큰$6$30
    컨텍스트 창500,0001,050,000
    장문맥 추가요금 기준200K 초과272K 초과
    장문맥 입력 단가$4$10
    장문맥 출력 단가$12$45

    여기서 주의해야 할 부분이 있습니다. 표의 $2/$6과 $5/$30만 보고 실제 비용을 계산하면 안 됩니다.

    Grok 4.6은 프롬프트가 20만 토큰을 넘으면 해당 요청의 입력·캐시·출력 가격이 각각 $4/$1/$12로 올라갑니다. GPT-5.6 Sol도 입력이 27만2천 토큰을 넘으면 전체 요청에 입력 2배, 출력 1.5배의 장문맥 단가가 적용됩니다.

    예를 들어 30만 토큰을 넣는다면

    캐시를 사용하지 않고 입력 30만 토큰, 출력 2만 토큰이 발생했다고 가정해보겠습니다.

    Grok 4.6

    • 입력: 0.3 × $4 = $1.20
    • 출력: 0.02 × $12 = $0.24
    • 합계: 약 $1.44

    GPT-5.6 Sol

    • 입력: 0.3 × $10 = $3.00
    • 출력: 0.02 × $45 = $0.90
    • 합계: 약 $3.90

    이 조건에서는 Grok 4.6의 비용 부담이 훨씬 낮습니다.

    다만 입력이 50만 토큰을 넘어가기 시작하면 이야기가 달라집니다. Grok 4.6은 한 요청의 컨텍스트 한도가 50만 토큰이므로 자료를 나누거나 검색·RAG 구조를 사용해야 합니다. GPT-5.6 Sol은 최대 105만 토큰까지 지원하므로 대규모 코드베이스나 수백 페이지 자료를 한 컨텍스트에서 처리해야 하는 작업에는 구조적으로 유리합니다.

    성능은 정말 Grok 4.6과 GPT-5.6 Sol이 동급일까

    “두 모델이 61점으로 동점”이라는 설명을 자주 볼 수 있지만, reasoning 설정까지 확인해야 합니다.

    SpaceXAI가 공개한 비교표에서 Artificial Analysis Intelligence Index 점수는 Grok 4.6 High가 61, GPT-5.6 Sol Max가 61입니다. Artificial Analysis의 독립 측정에서도 Grok 4.6 High는 61점을 기록합니다.

    그렇다고 두 모델의 모든 작업 성능이 같다는 뜻은 아닙니다.

    평가Grok 4.6GPT-5.6 Sol우위
    AA Intelligence Index61 High61 Max동률
    CursorBench 3.269.9% High67.2% MaxGrok
    DeepSWE 1.165.9%73.0%GPT
    FrontierCode 1.1 Extended61.3%60.6%Grok 근소 우위
    Terminal-Bench 3.026.0%34.6%GPT
    APEX-Agents57.5%56.7%Grok 근소 우위

    SpaceXAI의 발표 자료 자체에서도 평가 항목에 따라 결과가 엇갈립니다. 특히 Cursor가 실제 다중 파일 작업을 기반으로 운영하는 CursorBench 3.2에서는 Grok 4.6 High가 69.9%, GPT-5.6 Sol Max가 67.2%를 기록했습니다. CursorBench의 Extra High 설정에서는 Grok 4.6이 70.8%까지 올라갑니다.

    반대로 DeepSWE와 Terminal-Bench에서는 GPT-5.6 Sol이 앞섭니다. 따라서 “Grok이 GPT를 이겼다” 또는 “GPT가 더 좋은 코딩 모델이다”라고 한 문장으로 정리하기는 어렵습니다. 사용하는 에이전트 하네스와 reasoning 단계, 작업 유형이 결과를 바꿉니다.

    코딩 작업이라면 Grok 4.6이 유리한 경우

    Grok 4.6은 이번 업데이트에서 장시간 에이전트와 코드베이스를 오가는 작업에 초점을 맞췄습니다. SpaceXAI는 여러 단계를 거치는 조사, 코드 분석, 애플리케이션 구현과 반복 수정 능력을 주요 개선점으로 설명합니다.

    특히 다음과 같은 작업은 직접 시험해볼 가치가 있습니다.

    • 여러 파일을 한꺼번에 수정하는 작업
    • 기존 코드베이스에서 기능 하나를 완성하는 작업
    • UI를 만들고 반복적으로 고치는 작업
    • 비용이 많이 발생하는 장시간 코딩 에이전트
    • 출력 토큰이 많이 쌓이는 자동화 작업

    CursorBench 결과와 낮은 출력 단가를 함께 보면, 에이전트가 여러 차례 코드를 읽고 수정하고 다시 확인하는 구조에서는 Grok 4.6의 비용 대비 성능이 매력적입니다. Artificial Analysis도 Grok 4.6이 GPT-5.6 Sol과 비슷한 Intelligence Index를 기록하면서 낮은 토큰 가격을 유지한 점을 주요 특징으로 평가했습니다.

    GPT-5.6 Sol이 더 적합한 경우

    첫 번째는 대용량 컨텍스트입니다.

    500K와 1.05M의 차이는 단순한 숫자 차이가 아닙니다. 큰 저장소, 긴 계약서 묶음, 대량의 연구 자료처럼 입력 자체가 50만 토큰을 넘어가면 Grok 4.6은 한 번에 담을 수 없습니다. GPT-5.6 Sol은 같은 자료를 하나의 컨텍스트 안에서 처리할 여지가 더 큽니다.

    두 번째는 터미널과 긴 소프트웨어 엔지니어링 작업입니다. 공개된 DeepSWE와 Terminal-Bench 결과만 놓고 보면 GPT-5.6 Sol이 Grok 4.6보다 높습니다.

    세 번째는 높은 reasoning 단계를 사용하는 품질 우선 작업입니다. GPT-5.6 Sol은 none부터 max까지 reasoning effort를 조절할 수 있고, OpenAI는 복잡한 작업에 max 설정과 다중 에이전트 방식을 제공하고 있습니다.

    속도 비교는 토큰 생성 속도만 보면 안 된다

    Artificial Analysis가 현재 공개한 Grok 4.6 High와 GPT-5.6 Sol Medium 비교에서는 Grok이 초당 출력 토큰 수에서는 근소하게 빠르지만, 첫 토큰이 나오기까지 걸리는 시간은 GPT-5.6 Sol Medium이 더 짧았습니다. 다만 reasoning 설정이 High와 Medium으로 서로 달라 완전히 동일한 조건의 비교로 받아들여서는 안 됩니다.

    여기에 각 업체의 별도 고속 처리 옵션까지 들어가면 결과가 더 달라집니다.

    SpaceXAI는 Grok 4.6에 기본 가격의 2배인 Fast 변형을 제공하고 있습니다. OpenAI 역시 GPT-5.6 Sol Fast 모드를 제공하며, 공식 설명상 Standard 대비 최대 2.5배 빠른 처리에 가격은 2배입니다.

    따라서 실제 서비스에 넣기 전에는 평균 토큰 속도 하나보다 다음 네 가지를 측정하는 편이 낫습니다.

    1. 첫 토큰까지 걸리는 시간
    2. 작업 전체 완료 시간
    3. 한 작업에 소비되는 총 토큰
    4. 성공한 작업 한 건당 실제 비용

    에이전트는 답변 한 번으로 끝나지 않기 때문에 토큰 단가가 낮아도 반복 횟수가 많으면 비용이 커질 수 있고, 반대로 비싼 모델이라도 적은 단계로 작업을 끝내면 전체 비용은 낮아질 수 있습니다.

    장문 문서 작업에서는 500K와 1.05M 중 무엇이 중요한가

    100K~200K 정도의 문서라면 두 모델 모두 컨텍스트 크기 때문에 선택이 갈릴 가능성은 낮습니다. 이 범위에서는 품질과 작업당 비용을 먼저 보는 편이 낫습니다.

    200K~500K에서는 Grok 4.6도 한 요청으로 처리할 수 있지만 장문맥 단가가 적용됩니다. GPT-5.6 Sol 역시 272K를 넘으면 별도 장문맥 요금이 적용됩니다.

    500K~1.05M이라면 GPT-5.6 Sol이 명확한 선택지가 됩니다. Grok 4.6으로 같은 작업을 수행하려면 문서를 나누거나, 검색 기반으로 필요한 부분만 컨텍스트에 넣는 구조가 필요합니다.

    다만 컨텍스트 창이 크다고 항상 결과가 더 정확한 것은 아닙니다. 실제 서비스에서는 자료 전체를 한 번에 밀어 넣는 방식과 필요한 내용만 검색해서 전달하는 방식을 함께 테스트하는 것이 좋습니다.

    Grok 4.6 GPT-5.6 Sol 비교를 위해 AI 모델의 가격과 속도, 장문맥 처리 능력을 살펴보는 개발 환경
    Grok 4.6 GPT-5.6 Sol 비교를 위해 AI 모델의 가격과 속도, 장문맥 처리 능력을 살펴보는 개발 환경

    결국 어떤 모델을 선택해야 할까

    비용을 가장 중요하게 본다면 Grok 4.6부터 테스트하는 편이 합리적입니다. 특히 많은 출력을 생성하는 코딩·리서치 에이전트에서는 $6의 기본 출력 단가가 큰 장점입니다.

    반대로 50만 토큰보다 큰 컨텍스트, 터미널 중심 개발, 긴 자료를 한 요청에서 유지해야 하는 작업​이라면 GPT-5.6 Sol의 105만 토큰 컨텍스트가 실질적인 이점이 됩니다.

    코딩만 놓고 하나를 무조건 고를 필요도 없습니다. 공개 평가에서 Grok 4.6은 CursorBench에 강했고 GPT-5.6 Sol은 DeepSWE와 Terminal-Bench에 강했습니다. 가장 확실한 방법은 실제로 사용하는 코드 저장소에서 20~50개의 대표 작업을 뽑아 성공률, 총비용, 완료시간을 함께 비교하는 것입니다.

    선택 체크리스트

    Grok 4.6부터 테스트할 조건

    • 월 API 비용을 줄이는 것이 중요하다
    • 출력 토큰 사용량이 많다
    • 입력이 대체로 500K 이하다
    • 다중 파일 코딩과 반복 수정 작업이 많다
    • 에이전트를 장시간 반복 실행한다

    GPT-5.6 Sol부터 테스트할 조건

    • 500K를 넘는 컨텍스트가 자주 필요하다
    • 터미널 작업 비중이 크다
    • 대규모 코드베이스·문서 묶음을 한 번에 다룬다
    • 최대 reasoning 품질이 비용보다 중요하다

    둘 다 테스트할 조건

    • 모델 사용료보다 작업 실패 비용이 훨씬 크다
    • 장시간 에이전트를 실제 업무에 넣을 예정이다
    • 벤치마크와 비슷하지 않은 자체 업무 데이터가 있다

    핵심 요약

    Grok 4.6은 GPT-5.6 Sol과 같은 61점의 Artificial Analysis Intelligence Index를 기록하는 설정이 있으면서 기본 출력 가격은 100만 토큰당 $6입니다. GPT-5.6 Sol의 기본 출력 가격은 $30입니다. 비용 차이는 분명합니다.

    대신 GPT-5.6 Sol은 105만 토큰 컨텍스트를 제공해 Grok 4.6의 50만 토큰보다 두 배 이상 큽니다. 코딩 성능도 평가별로 우위가 엇갈리므로, “Grok이 더 싸니까 무조건 낫다”거나 “GPT가 상위 모델이라 항상 낫다”는 식으로 선택하기는 어렵습니다.

    500K 이하의 비용 민감형 에이전트라면 Grok 4.6, 500K를 넘는 장문맥과 터미널 중심 작업이라면 GPT-5.6 Sol을 우선 검토하는 것이 현재 공개 자료에 가장 가까운 판단입니다.

    FAQ

    Grok 4.6이 GPT-5.6 Sol보다 정말 5배 저렴한가?

    기본 출력 토큰 가격만 비교하면 $6 대 $30으로 5배 차이가 납니다. 입력은 $2 대 $5입니다. 하지만 장문맥에서는 양쪽 모두 가격이 올라가며 캐시 사용량과 실제 출력 토큰 수도 비용에 영향을 주므로 최종 작업 비용이 항상 정확히 5배 차이 나는 것은 아닙니다.

    Grok 4.6과 GPT-5.6 Sol 중 어느 쪽이 더 똑똑한가?

    하나의 점수로 단정하기 어렵습니다. Artificial Analysis Intelligence Index에서는 Grok 4.6 High와 GPT-5.6 Sol Max가 각각 61점인 비교가 있지만, 코딩·터미널·에이전트 평가에서는 결과가 서로 다릅니다.

    코딩에는 Grok 4.6이 더 좋은가?

    CursorBench 3.2에서는 Grok 4.6이 GPT-5.6 Sol보다 높은 설정이 확인됩니다. 반면 DeepSWE와 Terminal-Bench에서는 GPT-5.6 Sol이 앞섭니다. 코드 수정 방식과 에이전트 환경에 따라 선택이 달라집니다.

    긴 PDF나 대규모 코드베이스에는 어느 쪽이 좋은가?

    500K 이하라면 둘 다 후보가 될 수 있습니다. 500K를 넘는 데이터를 한 번에 모델 컨텍스트에 넣어야 한다면 1.05M 컨텍스트를 제공하는 GPT-5.6 Sol이 구조적으로 유리합니다.

    API 가격은 앞으로 바뀔 수 있나?

    가능합니다. 두 업체 모두 모델·처리 모드·가격 정책을 계속 업데이트하고 있으므로 실제 서비스를 배포하기 전 공식 가격 문서를 다시 확인하는 것이 좋습니다. OpenAI는 2026년 7월에도 GPT-5.6 계열의 일부 가격과 Fast 처리 정책을 조정했습니다.

    출처 및 참고자료

    1. SpaceXAI — Introducing Grok 4.6, 2026-08-12. 모델 공개일, 주요 목적, 벤치마크 및 기본 가격.
    2. SpaceXAI Docs — Grok 4.6 / Release Notes, 2026-08. 컨텍스트 크기와 기본·장문맥 API 요금.
    3. OpenAI — GPT-5.6: Frontier intelligence that scales with your ambition, 2026-07-09. GPT-5.6 Sol의 공개 평가와 기능.
    4. OpenAI API Docs — GPT-5.6 Sol Model, 2026-08-14 확인. 1.05M 컨텍스트, 128K 최대 출력, API 가격 및 장문맥 과금.
    5. Artificial Analysis — Grok 4.6 benchmarks and analysis, 2026-08. 독립 Intelligence Index와 비용 효율 평가.
    6. Cursor — CursorBench 3.2, 2026-08-14 확인. 실제 다중 파일 코딩 에이전트 평가 결과.
  • 제미나이 3.7 플래시 가격·사용법 총정리, 3.6과 무엇이 달라졌나

    제미나이 3.7 플래시 가격·사용법 총정리, 3.6과 무엇이 달라졌나

    구글은 2026년 8월 13일(미국 현지시간) Gemini 3.7 Flash를 정식 출시(GA) 했습니다. 한국 공식 블로그 발표일은 8월 14일입니다. 개발자는 Google AI Studio와 Gemini API에서 바로 사용할 수 있고, Gemini Spark에는 Google AI Pro·Ultra 구독자를 대상으로 3.7 Flash가 적용됩니다.

    가격부터 보면 조금 주의할 부분이 있습니다. Gemini API 무료 티어에서는 3.7 Flash의 입력·출력 토큰 비용이 무료이고, 유료 티어는 2026년 12월 31일까지 입력 100만 토큰당 0.75달러, 출력 100만 토큰당 3.75달러입니다. 2027년 1월 1일부터는 각각 1.50달러와 7.50달러로 올라갑니다.

    그리고 가장 헷갈리기 쉬운 부분이 하나 있습니다.

    현재 3.7 Flash가 3.6 Flash보다 API 단가가 더 싼 것은 아닙니다. 구글이 3.7 출시 프로모션 단가를 기존 3.6 Flash에도 동일하게 적용했기 때문에 2026년 말까지 두 모델의 현재 공식 단가는 같습니다. 차이는 가격보다는 코딩·에이전트·웹 개발 성능에 있습니다.

    제미나이 3.7 플래시 핵심만 먼저 보기

    항목2026년 8월 14일 기준
    정식 출시2026년 8월 13일 미국 현지시간
    모델 IDgemini-3.7-flash
    무료 사용Gemini API 무료 티어 지원
    유료 API 입력 가격100만 토큰당 $0.75, 2026년 12월 31일까지
    유료 API 출력 가격100만 토큰당 $3.75, 2026년 12월 31일까지
    2027년 입력 가격100만 토큰당 $1.50
    2027년 출력 가격100만 토큰당 $7.50
    입력 컨텍스트최대 1,048,576 토큰
    최대 출력65,536 토큰
    주요 입력텍스트·이미지·영상·오디오·PDF
    출력텍스트
    주요 용도코딩, AI 에이전트, 업무 자동화, 복잡한 멀티스텝 작업
    AI Studio사용 가능
    Gemini API사용 가능
    Gemini SparkPro·Ultra 구독자에게 적용

    모델 사양과 배포 경로는 Google AI for Developers와 Google DeepMind의 공식 모델 카드에서 확인할 수 있습니다.

    제미나이 3.7 플래시 가격은 얼마인가

    Gemini API 무료 티어

    개발자가 테스트하거나 소규모 프로젝트를 시작하는 경우 Google AI Studio와 Gemini API의 무료 티어를 이용할 수 있습니다. 3.7 Flash 가격표에는 무료 티어의 입력·출력이 모두 무료로 표시돼 있습니다. 다만 무료 티어는 모델 접근 범위와 사용량 제한이 존재하므로 실제 호출 한도는 자신의 프로젝트에서 확인하는 것이 안전합니다.

    Gemini API 유료 티어

    구분2026년 12월 31일까지2027년 1월 1일부터
    입력 100만 토큰$0.75$1.50
    출력 100만 토큰$3.75$7.50
    Batch 입력 100만 토큰$0.375$0.75
    Batch 출력 100만 토큰$1.875$3.75

    표준 API 외에도 Batch와 Flex 요금제가 제공되며, Batch·Flex는 일반 Standard보다 낮은 단가가 적용됩니다. 공식 가격표는 서비스별 조건이 바뀔 수 있으므로 실제 운영 비용을 계산할 때는 최신 Gemini Developer API 가격표를 다시 확인해야 합니다.

    3.6 Flash와 현재 가격은 같다

    3.7 Flash 발표 당시에는 이전 3.6 Flash의 기존 가격과 비교해 상당히 저렴해졌다는 보도가 많았습니다. Reuters도 출시 단가를 3.6 Flash의 기존 가격 대비 절반 수준이라고 설명했습니다.

    하지만 구글은 동시에 새 프로모션 가격을 3.6 Flash에도 적용했습니다. 따라서 지금 모델을 새로 선택하는 개발자라면 단순히 “3.7이 더 싸니까 바꾼다”기보다는 성능과 호환성을 기준으로 판단하는 편이 맞습니다.

    제미나이 3.7 플래시 사용법

    사용 목적에 따라 가장 쉬운 방법이 다릅니다.

    사용 목적추천 경로특징
    모델을 직접 테스트Google AI Studio별도 앱 개발 없이 프롬프트 테스트
    프로그램·서비스 개발Gemini API앱·웹·자동화 서비스에 모델 연결
    개인용 AI 에이전트Gemini SparkGoogle AI Pro·Ultra 구독자 대상
    기업용 AI 구축Gemini Enterprise 계열기업 워크플로우와 에이전트 구축
    에이전트 개발Antigravity 등복잡한 개발·에이전트 작업

    Google DeepMind는 3.7 Flash의 공식 배포 경로로 Gemini App의 Spark, Gemini Enterprise App, Gemini Enterprise Agent Platform, Google AI Studio, Gemini API, Google Antigravity를 명시하고 있습니다.

    방법 1. Google AI Studio에서 사용하기

    가장 간단한 개발자용 체험 방법입니다.

    1. Google AI Studio에 접속합니다.
    2. Google 계정으로 로그인합니다.
    3. 사용할 모델에서 Gemini 3.7 Flash를 선택합니다.
    4. 텍스트나 파일을 입력해 결과를 테스트합니다.
    5. 실제 애플리케이션에 연결하려면 Gemini API용 프로젝트와 키를 준비합니다.

    공식 모델 페이지에는 3.7 Flash를 AI Studio에서 바로 시험할 수 있는 경로가 제공됩니다.

    방법 2. Gemini API에서 사용하기

    개발 환경에서는 모델 ID를 다음과 같이 사용합니다.

    gemini-3.7-flash

    Google의 공식 Quickstart에서도 Python·JavaScript·REST 요청 모두 이 모델 ID를 사용합니다. 3.7 Flash는 이미 GA 상태이므로 단순한 프리뷰 모델이 아니라 프로덕션용으로 사용할 수 있는 정식 모델입니다.

    방법 3. Gemini Spark에서 사용하기

    일반 소비자 입장에서는 이 부분을 구분해야 합니다.

    구글이 이번 발표에서 명시한 Gemini 앱 측 3.7 Flash 적용 대상은 Gemini Spark입니다. Spark는 Google AI Pro 및 Ultra 구독자에게 제공되는 개인용 AI 에이전트이며, 3.7 Flash 적용으로 Google Workspace 도구 사용과 복잡한 여러 단계 업무의 정확도를 개선했다고 구글은 설명합니다.

    따라서 “일반 Gemini 채팅 화면에서 모든 사용자가 3.7 Flash를 직접 모델로 선택할 수 있다”는 의미로 해석하면 안 됩니다. 개발자는 AI Studio/API, 개인용 에이전트 이용자는 Spark처럼 사용 경로를 나눠서 보는 것이 정확합니다.

    제미나이 3.7 플래시와 3.6 플래시 차이

    3.7 Flash는 완전히 별개의 계열이 아니라 Gemini 3.6 Flash를 기반으로 개선한 모델입니다. Google DeepMind 모델 카드에도 3.7 Flash가 3.6 Flash를 기반으로 만들어졌다고 명시돼 있습니다.

    주요 차이 비교

    비교 항목Gemini 3.6 FlashGemini 3.7 Flash
    기반이전 Flash 세대3.6 Flash 기반 개선
    컨텍스트약 100만 토큰약 100만 토큰
    주요 변화효율·코딩·멀티모달 개선코딩·에이전트·웹 개발·업무 자동화 추가 개선
    FrontierCode 1.134.4%43.6%
    DeepSWE v1.148.6%65.3%
    Web/Code ArenaElo 1,538Elo 1,588
    AutomationBench17.0%30.4%
    GDP.pdf22.0%34.0%
    현재 Standard API 가격$0.75 / $3.75$0.75 / $3.75

    위 벤치마크는 Google DeepMind가 공개한 평가 결과이므로 실제 사용 환경의 성능과 동일하다고 단정할 수는 없습니다. 다만 코딩·장기 소프트웨어 작업·업무 자동화 관련 여러 평가에서 3.7이 3.6보다 높은 수치를 기록한 것은 일관적입니다.

    독립 평가기관 Artificial Analysis에서도 high reasoning 설정 기준 3.7 Flash의 Intelligence Index는 56, 3.6 Flash는 52로 평가됐습니다. 3.7 Flash의 측정 출력 속도는 초당 약 340토큰으로 나타났습니다.

    연합뉴스도 Artificial Analysis 자료를 인용해 3.7 Flash의 빠른 출력 속도와 가격 경쟁력을 보도하면서, 동시에 종합 지능 성능에서는 최상위 모델과 차이가 있다는 점을 짚었습니다.

    즉 3.7 Flash는 “무조건 최고 성능 모델”이라기보다 빠른 속도와 비교적 낮은 비용을 유지하면서 코딩·에이전트 성능을 끌어올린 실무형 모델에 가깝습니다.

    노트북에서 AI 모델과 API를 활용해 코딩 작업을 진행하는 개발 환경을 표현한 이미지
    노트북에서 AI 모델과 API를 활용해 코딩 작업을 진행하는 개발 환경을 표현한 이미지

    3.7 Flash에서 달라진 기능

    코딩과 디버깅

    구글은 3.7 Flash가 디버깅, 이슈 해결, 실제 실행 가능한 코드 생성에서 3.6보다 개선됐다고 설명합니다. 특히 여러 단계의 수정과 재시도가 필요한 에이전트형 코딩 환경을 주요 적용 분야로 제시했습니다.

    웹 개발

    스크린샷이나 디자인 시스템을 참고해 웹 인터페이스를 구현하는 작업도 개선 대상으로 강조됐습니다. Google의 WebDev 계열 평가에서도 3.7 Flash가 3.6보다 높은 점수를 기록했습니다.

    복잡한 업무 자동화

    업무 문서를 읽고 여러 도구를 연결해 단계적으로 처리하는 에이전트 작업 역시 핵심 개선 영역입니다. Google은 AutomationBench에서 3.7 Flash가 30.4%, 3.6 Flash가 17.0%를 기록했다고 밝혔습니다.

    멀티모달 입력

    3.7 Flash는 텍스트뿐 아니라 이미지·비디오·오디오·PDF를 입력으로 받을 수 있습니다. 최대 입력 컨텍스트는 1,048,576토큰, 최대 출력은 65,536토큰입니다. 출력 형식 자체는 텍스트입니다.

    Thinking Level

    3.7 Flash에서는 low, medium, high 세 단계의 thinking level을 지원하며 기본값은 medium입니다. 3.6 Flash에서 사용할 수 있었던 minimal을 3.7 Flash에 지정하면 오류가 발생한다는 점도 마이그레이션할 때 확인해야 합니다.

    3.6에서 3.7로 바꾸는 것이 좋은 경우

    다음에 해당한다면 3.7을 먼저 테스트할 이유가 있습니다.

    • 코드 생성이나 버그 수정 비중이 높다.
    • AI 에이전트가 여러 단계의 작업을 연속 수행한다.
    • 웹 UI·프론트엔드 생성 작업이 많다.
    • PDF나 복잡한 업무 문서를 처리한다.
    • 3.6에서 반복적인 재시도나 도구 호출 실패가 비용을 늘리고 있다.
    • 현재 동일한 프로모션 단가라면 더 새 모델을 검증해 보고 싶다.

    반대로 단순 분류·요약처럼 성능 요구가 낮은 대량 작업에서는 Flash-Lite 계열을 포함해 더 저렴한 모델과 비교할 필요가 있습니다. 3.7이 모든 작업에서 가장 경제적이라는 의미는 아닙니다. Google도 별도의 고처리량·저비용 모델로 Flash-Lite 계열을 제공하고 있습니다.

    지금 확인할 체크리스트

    • 단순 체험이라면 AI Studio에서 먼저 테스트한다.
    • API 무료 티어와 유료 티어를 혼동하지 않는다.
    • 유료 API 프로모션 가격 종료일이 2026년 12월 31일임을 확인한다.
    • 2027년부터 입력·출력 가격이 각각 두 배로 바뀌는 점을 비용 계획에 반영한다.
    • 3.6과 현재 API 가격이 동일하다는 점을 확인한다.
    • 3.6에서 이전한다면 minimal thinking 설정 사용 여부를 확인한다.
    • 실제 업무 데이터로 3.6과 3.7의 품질·지연시간·토큰 사용량을 직접 비교한다.

    FAQ

    제미나이 3.7 플래시는 무료인가요?

    Gemini API에는 무료 티어가 있습니다. 공식 가격표에서 3.7 Flash의 무료 티어 입력·출력은 무료로 표시됩니다. 다만 무료 티어에는 사용량과 기능 제한이 있으므로 실제 프로젝트의 할당량을 확인해야 합니다.

    제미나이 3.7 플래시 API 가격은 얼마인가요?

    2026년 12월 31일까지 Standard 유료 티어 기준으로 입력 100만 토큰당 0.75달러, 출력 100만 토큰당 3.75달러입니다. 2027년 1월 1일부터 각각 1.50달러와 7.50달러가 적용됩니다.

    3.7 Flash가 3.6 Flash보다 더 저렴한가요?

    현재는 아닙니다. 구글이 3.7 Flash의 출시 프로모션 단가를 3.6 Flash에도 동일하게 적용했기 때문에 2026년 말까지 공식 Standard 단가는 같습니다.

    제미나이 3.7 플래시는 어디에서 사용할 수 있나요?

    개발자는 Google AI Studio와 Gemini API에서 사용할 수 있습니다. 공식 모델 카드에는 Gemini App의 Spark, Gemini Enterprise 계열, AI Studio, Gemini API, Antigravity 등이 배포 경로로 명시돼 있습니다.

    3.6 Flash에서 바로 바꿔도 되나요?

    API 모델 ID를 gemini-3.7-flash로 변경해 테스트할 수 있지만, 프로덕션 환경에서는 먼저 회귀 테스트를 하는 편이 좋습니다. 특히 3.7은 minimal thinking level을 지원하지 않으므로 3.6에서 해당 설정을 사용했다면 수정이 필요합니다.

    출처 및 참고자료

    1. Google Korea Blog, 「제미나이 3.7 플래시를 소개합니다」, 2026-08-14
      https://blog.google/intl/ko-kr/company-news/technology/introducing-gemini-3-7-flash-kr/
    2. Google AI for Developers, 「Gemini 3.7 Flash」, 2026-08-13 업데이트
      https://ai.google.dev/gemini-api/docs/models/gemini-3.7-flash
    3. Google AI for Developers, 「Gemini Developer API pricing」, 2026-08-14 확인
      https://ai.google.dev/gemini-api/docs/pricing
    4. Google DeepMind, 「Gemini 3.7 Flash – Model Card」, 2026-08-13
      https://deepmind.google/models/model-cards/gemini-3-7-flash/
    5. Reuters, 「Google unveils Gemini 3.7 Flash AI model for coding, agent workflows」, 2026-08-13
      https://www.reuters.com/business/google-unveils-gemini-37-flash-ai-model-coding-agent-workflows-2026-08-13/
    6. Artificial Analysis, 「Gemini 3.7 Flash – Intelligence, Performance & Price Analysis」, 2026-08-13 평가 확인
      https://artificialanalysis.ai/models/gemini-3-7-flash
    7. 연합뉴스, 「또 경량 AI만 내놓은 구글…최상위모델 지연에 그록에도 밀려」, 2026-08-14
      https://www.yna.co.kr/view/AKR20260814027300091