Gemini 3.9 Flash 나왔나요? 지금 최신은 3.8 Flash — 3.7과 직접 잰 속도·비용
2026년 9월 22일 기준 Gemini 3.9 Flash는 미출시입니다. 최신 3.8 Flash의 사양·가격(2027년 2배 인상)과, 3.7 Flash와 같은 과제로 직접 잰 속도·비용·JSON 형식 준수 차이를 정리했습니다.
목차 보기
"Gemini 3.9 Flash"를 검색해서 들어오셨다면 결론부터 말씀드립니다. 2026년 9월 22일 현재, Gemini 3.9 Flash는 아직 나오지 않았습니다. 지금 쓸 수 있는 가장 새 Flash는 9월 2일에 정식 출시된 Gemini 3.8 Flash입니다. 저희는 AI 모델을 중계하는 서비스를 운영하고 있어서, 3.8과 직전 버전 3.7을 같은 과제로 직접 호출해 속도와 비용을 재 봤습니다.
3줄 요약
- 미출시 Gemini 3.9 Flash는 구글 공식 릴리스노트·모델 목록·가격표 어디에도 없습니다(9/22 확인). 떠도는 이야기는 커뮤니티 추측입니다.
- 지금 최신은 Gemini 3.8 Flash(9/2 정식 출시). 가격은 3.7과 같지만 2027년 1월 1일부터 입력·출력 단가가 2배가 됩니다.
- 직접 재 보니 속도는 3.7과 비슷했고, "JSON만 출력" 지시는 3.8이 3번 모두 지켰습니다(3.7은 3번 중 2번 코드블록으로 감쌈).
Gemini 3.9 Flash는 출시됐나요?
아직 출시되지 않았습니다. 2026년 9월 22일 기준으로 다음 네 곳을 확인했고, 모두 3.9가 없었습니다.
- Gemini API 릴리스노트 — 가장 최근 Flash 항목은
gemini-3.8-flash정식 출시(9/2) - Gemini API 모델 목록·가격표 — 3.9 없음
- Google Cloud Vertex AI 릴리스노트 — 3.9 없음
- 모델 중계 서비스 OpenRouter 모델 목록(444개) — "gemini-3.9"가 들어간 모델 0개
3.9 이야기는 해외 커뮤니티 댓글과 비공식 블로그의 추측에서 나왔습니다. 다만 Flash는 새 버전이 짧은 간격으로 나오고 있어서(3.7은 8월 13일, 3.8은 9월 2일), 곧 나올 가능성은 있습니다. 출시되면 이 글을 바로 고치겠습니다.
지금 최신 Gemini 3.8 Flash는 어떤 모델인가요?
| 항목 | Gemini 3.8 Flash |
|---|---|
| 출시 | 2026년 9월 2일 정식 출시, 모델 ID gemini-3.8-flash |
| 입력 한도 | 1,048,576 토큰(약 100만) |
| 출력 한도 | 65,536 토큰 |
| 입력 형식 | 텍스트·이미지·영상·오디오·PDF |
| 추론(thinking) | low · medium · high 세 단계 |
구글이 공개한 3.8 Flash 모델카드 기준으로, 소프트웨어 개발 과제(DeepSWE)에서 3.7의 65.3%에서 73.7%로, 터미널 작업(Terminal-bench 2.1)에서 85.8%에서 89.4%로 올랐습니다. 벤치마크는 구글이 직접 잰 값이라, 아래에서 저희가 직접 잰 결과와 함께 보시는 것을 권합니다.
Gemini 3.8 Flash 가격은 얼마인가요? 언제 오르나요?
| 100만 토큰당(USD) | 2026년 12월 31일까지 | 2027년 1월 1일부터 |
|---|---|---|
| 입력 | $0.75 | $1.50 |
| 출력(추론 토큰 포함) | $3.75 | $7.50 |
| 컨텍스트 캐시 | $0.075 | $0.15 |
출처: Gemini API 가격표(2026-09-22 확인). 3.7 Flash도 같은 가격이며, 배치 요청은 절반입니다.
월 비용 계산 예시 — 한국어 요약을 하루 1만 건 돌린다면
- 3.8 Flash 실측 1건 $0.00197 × 1만 건 × 30일 ≈ 월 $591 (2026년 가격)
- 같은 사용량을 2027년 가격(2배)으로 계산하면 ≈ 월 $1,182
- 같은 작업을 배치 요청(절반 가격)으로 돌릴 수 있다면 ≈ 월 $296 (2026년)
위 실측의 1건 비용을 그대로 곱한 값입니다. 입력·출력 길이가 달라지면 비례해서 바뀝니다.
지금 가격은 연말까지만 적용되는 도입가입니다. 내년 예산을 잡는다면 두 배로 계산해 두는 것이 안전합니다. 추론(thinking) 토큰도 출력 요금에 포함되므로, 짧은 답에도 출력 토큰이 예상보다 많이 나올 수 있습니다. 아래 실측에서 세 문장 요약에 500~650 토큰이 나온 것도 이 때문입니다.
3.7 Flash와 3.8 Flash, 직접 재 보면 뭐가 다른가요?
같은 과제 세 가지를 두 모델에 각각 3번씩 보내고 중간값을 적었습니다. 모델 설정은 바꾸지 않았습니다(기본 추론 수준, 최대 출력 800토큰).
| 과제 | 모델 | 첫 글자까지 | 전체 응답 | 출력 토큰 | 1회 비용 |
|---|---|---|---|---|---|
| 한국어 3문장 요약 | 3.7 Flash | 3.02초 | 3.43초 | 652 | $0.00251 |
| 3.8 Flash | 3.06초 | 3.39초 | 508 | $0.00197 (−22%) | |
| 문장에서 JSON 추출 | 3.7 Flash | 1.99초 | 2.20초 | 340 | $0.00132 |
| 3.8 Flash | 2.43초 | 2.67초 | 369 | $0.00143 (+8%) | |
| 짧은 Node.js 코드 | 3.7 Flash | 3.04초 | 3.96초 | 760 | $0.00289 |
| 3.8 Flash | 2.86초 | 3.51초 | 731 | $0.00278 (−4%) |
측정: 2026-09-22 19시 18분(KST) 무렵, 서울에서 스트리밍 호출, 과제별 3회 중간값. 비용은 호출 결과에 찍힌 실제 청구액(USD).
숫자로 보면 이렇습니다.
- 속도는 사실상 같습니다. 차이가 0.5초 이내라, 속도 때문에 갈아탈 이유는 없습니다.
- 비용은 과제에 따라 다릅니다. 단가가 같으니 결국 출력 토큰 수가 비용을 정합니다. 요약에서는 3.8이 짧게 답해 22% 쌌고, JSON 추출에서는 오히려 8% 비쌌습니다.
- 가장 큰 차이는 형식 지키기였습니다. "설명 없이 JSON만 출력하라"고 했을 때, 3.8은 3번 모두 JSON만 돌려줬습니다. 3.7은 3번 중 2번을
```json코드블록으로 감쌌습니다.
마지막 차이는 실무에서 큽니다. 응답을 프로그램이 바로 읽는 구조라면, 3.7은 코드블록을 벗겨 내는 처리를 따로 넣어야 합니다. 3.8은 그 처리가 없어도 대부분 바로 읽힙니다. 그래도 운영에서는 두 경우를 모두 처리하도록 짜 두는 것이 안전합니다.
재현 방법 — 실제로 보낸 요청
세 과제의 프롬프트는 아래와 같습니다. 모델 이름만 google/gemini-3.7-flash / google/gemini-3.8-flash로 바꿔 각각 3번씩 보냈습니다.
- 요약: "다음 내용을 한국어 3문장으로 요약하세요: 서버 스냅샷은 특정 시점의 디스크 상태를 저장해 되돌리는 기능이다. … 업데이트 직전에 찍고 안정되면 지우는 것이 좋다."(4문장 원문)
- JSON 추출: "다음 문장에서 이름, 전화번호, 요청사항을 JSON 으로만 출력하세요(설명 없이). '안녕하세요 김민수입니다. 010-1234-5678 로 연락 주시고, 다음 주 화요일에 서버 두 대 견적 부탁드립니다.'"
- 코드: "Node.js 로 1분마다 https://example.com 헬스체크를 하고 3번 연속 실패하면 콘솔에 경고를 찍는 짧은 코드를 작성하세요. 설명은 두 줄 이내."
curl https://openrouter.ai/api/v1/chat/completions -H "Authorization: Bearer $KEY" -H "Content-Type: application/json" -d '{"model":"google/gemini-3.8-flash","stream":true,"max_tokens":800,
"usage":{"include":true},
"messages":[{"role":"user","content":"(위 프롬프트)"}]}'
첫 글자까지 = 요청을 보낸 뒤 첫 글자 조각이 도착한 시간, 전체 응답 = 마지막 조각까지의 시간. 비용 = 응답의 usage.cost.
// 코드블록으로 감싸 와도 읽히게 const raw = reply.trim().replace(/^```(?:json)?\s*|\s*```$/g, ""); const data = JSON.parse(raw);
지금 3.8로 바꿔야 하나요, 3.9를 기다려야 하나요?
- 새로 만드는 서비스라면 3.8 Flash로 시작하세요. 가격이 같고 형식 지키기가 낫습니다. 구글도 새 프로젝트에는 3.8 Flash를 권하고 있습니다.
- 3.7로 잘 돌아가는 서비스라면 급하지 않습니다. 속도 차이가 없으니, 테스트 몇 건을 돌려 출력 형식과 비용을 먼저 비교해 보세요.
- 3.9를 기다릴 이유는 아직 없습니다. 출시일도 가격도 공식적으로 정해진 것이 없습니다. 나오면 모델 이름만 바꿔 같은 테스트를 돌려 보면 됩니다.
모델 이름을 코드에 박아 두기 싫다면, 저희 LLM 라우터처럼 요청에 맞는 모델을 자동으로 고르는 방식도 있습니다. 새 모델이 나올 때마다 코드를 고치지 않아도 됩니다.
자주 묻는 질문
Q. Gemini 3.9 Flash 출시일은 언제인가요?
공식 발표가 없습니다(2026-09-22 기준). 온라인에 도는 날짜는 추측입니다.
Q. Gemini 3.8 Flash와 3.7 Flash 가격이 같나요?
네. 100만 토큰당 입력 $0.75, 출력 $3.75로 같고, 둘 다 2027년 1월 1일부터 2배가 됩니다.
Q. 한국에서 원화로 Gemini API를 쓸 수 있나요?
퓨쳐인프라에서는 API 키 하나로 Gemini를 포함한 300종 이상 모델을 부르고, 부가세 포함 원화 잔액에서 차감합니다. 자세한 내용은 AI API 안내를 보세요.
- 작성: 서순명(퓨쳐인프라 서비스 기획) · 작성일 2026년 9월 22일. 3.9 Flash가 출시되면 이 글을 고치고 날짜를 갱신합니다.
- 근거: 구글 공식 가격표·릴리스노트·모델카드(아래 링크, 2026-09-22 확인)와 저희가 직접 호출한 측정값.
- 측정의 한계: 과제당 3회, 한 시간대, 서울 한 곳에서 잰 값입니다. 시간대·지역·요청 내용에 따라 달라질 수 있습니다.
- 이해관계: 퓨쳐인프라는 AI 모델 API를 중계하는 회사이며, 이 글에 자사 서비스 안내가 들어 있습니다.
- 참고: Gemini API 가격표 · Gemini API 릴리스노트 · Gemini 3.8 Flash 모델카드 · 구글 코리아 블로그 3.8 Flash 발표
댓글 0
로그인하면 댓글을 남길 수 있습니다.