Gemini 3.7 Flash — 3주 만의 후속작, 벤치마크로 뜯어보기
8월 13일 나온 Gemini 3.7 Flash를 차트와 자체 실측(TTFT 3.9s→1.34s)으로 정리했습니다. 에이전트 자동화 동급 1위, 실시간 챗은 설정 하나가 성패를 가릅니다.
목차 보기
구글이 8월 13일 Gemini 3.7 Flash를 내놨습니다. 3.6 Flash가 나온 지 딱 3주 만이라 처음엔 번호 장난인가 싶었는데, 벤치마크를 열어 보니 그건 아니었습니다. 저희는 모델 중계 플랫폼을 운영하는 입장이라 출시 당일 실서비스 경로에 물려 봤고, 이 글은 그 숫자와 실측을 "그래서 내 서비스에 갈아탈 가치가 있나" 기준으로 정리한 것입니다.
30초 요약
- 정체: 새 모델이 아니라 3.6 Flash의 추론 개정판. 그런데 에이전트·코딩 점수가 3주 만에 최대 1.8배 뛰었다.
- 포지션: 동급(중형·고속)에서 에이전트 자동화 1위, 코딩은 GPT-5.6·Grok 4.6과 오차범위 접전.
- 함정 하나: 기본 설정이면 첫 응답까지 4초. 스위치 하나 내리면 1.3초가 된다(아래 실측).
3주 만에 자기 점수를 이만큼 올렸다
구글 발표 기준, 전작 3.6 Flash와의 비교입니다. 프리트레이닝을 새로 한 게 아니라는 점을 감안하면 이례적인 폭입니다.
회색=3.6 Flash(7월), 파랑=3.7 Flash(8월). 출처: Google 발표 차트.
동급 모델과 붙여 보면
같은 체급 — 대형 플래그십이 아니라 "빠르고 싼 주력 모델"끼리의 비교입니다.
주의: 수치 대부분이 구글이 고른 차트에서 나왔습니다. 벤더 발표 벤치마크는 늘 자기에게 유리한 종목으로 짜입니다. Grok 4.6 점수는 별도 소스라 직접 비교엔 한계가 있습니다.
그래서, 내 서비스엔?
숫자보다 이게 중요합니다. 용도별로 갈랐습니다.
이 모델이 겨냥한 자리 그대로. 에이전트 벤치마크에서 동급 1위이고, 코딩도 상위권 접전. 동급 대비 토큰 단가가 절반 수준이라 하루 종일 돌리는 워크로드일수록 유리합니다.
기본값 그대로 쓰면 첫 응답 4초 — 체감상 탈락입니다. reasoning_effort를 minimal로 내리면 1.3초대로 살아납니다(아래 실측). 이 설정을 아느냐가 도입 성패를 가릅니다.
복잡한 설계 판단, 긴 문서의 정밀한 작성 같은 일은 여전히 플래그십(대형 모델) 몫입니다. Flash 라인은 "많이·빨리"용이지 "가장 잘"용이 아닙니다.
실측: 첫 토큰까지 걸린 시간
발표 자료엔 없는 이야기입니다. 출시 당일 저희 중계 경로에 붙여서 같은 프롬프트로 재봤습니다.
추론(thinking)이 켜진 채 나오는 게 기본값이라 생기는 지연입니다. 배치·에이전트 작업이면 켜두고, 대화형이면 끄세요.
바로 써보기
FutureInfra AI API에서 별도 신청 없이 호출됩니다. 모델명만 바꾸면 기존 코드가 그대로 돕니다.
curl https://futureinfra.ai/v1/ai/chat/completions \
-H "Authorization: Bearer $FUTUREINFRA_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "google/gemini-3.7-flash",
"reasoning_effort": "minimal",
"messages": [{"role": "user", "content": "안녕"}]
}'
베타 안내 — 아직 결제를 붙이지 않았습니다. 체험 크레딧을 다 쓰셨거나 베타 기간에 더 써보고 싶으시면 이메일만 남겨 주세요. 사람이 직접 확인하고 하루 안에 늘려드립니다.
출처: 9to5Google — 출시 보도 · MarkTechPost — 발표 정리 · explainx — 4개 모델 비교 · TTFT는 자체 실측(2026-08)
댓글 0
로그인하면 댓글을 남길 수 있습니다.