FutureInfra 콘솔
블로그

Gemini 3.7 Flash — 3주 만의 후속작, 벤치마크로 뜯어보기

8월 13일 나온 Gemini 3.7 Flash를 차트와 자체 실측(TTFT 3.9s→1.34s)으로 정리했습니다. 에이전트 자동화 동급 1위, 실시간 챗은 설정 하나가 성패를 가릅니다.

목차 보기

구글이 8월 13일 Gemini 3.7 Flash를 내놨습니다. 3.6 Flash가 나온 지 딱 3주 만이라 처음엔 번호 장난인가 싶었는데, 벤치마크를 열어 보니 그건 아니었습니다. 저희는 모델 중계 플랫폼을 운영하는 입장이라 출시 당일 실서비스 경로에 물려 봤고, 이 글은 그 숫자와 실측을 "그래서 내 서비스에 갈아탈 가치가 있나" 기준으로 정리한 것입니다.

지금 가입하면 웰컴 500P + 체험 크레딧 20,000P

무료로 시작하기

체험 크레딧은 가입 후 2주간 사용할 수 있습니다 · 카드 등록 없음

30초 요약

  • 정체: 새 모델이 아니라 3.6 Flash의 추론 개정판. 그런데 에이전트·코딩 점수가 3주 만에 최대 1.8배 뛰었다.
  • 포지션: 동급(중형·고속)에서 에이전트 자동화 1위, 코딩은 GPT-5.6·Grok 4.6과 오차범위 접전.
  • 함정 하나: 기본 설정이면 첫 응답까지 4초. 스위치 하나 내리면 1.3초가 된다(아래 실측).

3주 만에 자기 점수를 이만큼 올렸다

구글 발표 기준, 전작 3.6 Flash와의 비교입니다. 프리트레이닝을 새로 한 게 아니라는 점을 감안하면 이례적인 폭입니다.

DeepSWE v1.1 · 장기 SW 엔지니어링 49.0 65.3 FrontierCode 1.1 · 프로덕션 코드 품질 34.4 43.6 AutomationBench · 업무 자동화 에이전트 17.0 30.4

회색=3.6 Flash(7월), 파랑=3.7 Flash(8월). 출처: Google 발표 차트.

동급 모델과 붙여 보면

같은 체급 — 대형 플래그십이 아니라 "빠르고 싼 주력 모델"끼리의 비교입니다.

AutomationBench — 에이전트가 실제 업무를 끝내는가 Gemini 3.7 Flash30.4 GPT-5.6 Terra23.6 Claude Sonnet 510.7
DeepSWE v1.1 — 긴 호흡의 코딩 작업 GPT-5.6 Terra69.6 Grok 4.665.9 Gemini 3.7 Flash65.3 Claude Sonnet 553.8

주의: 수치 대부분이 구글이 고른 차트에서 나왔습니다. 벤더 발표 벤치마크는 늘 자기에게 유리한 종목으로 짜입니다. Grok 4.6 점수는 별도 소스라 직접 비교엔 한계가 있습니다.

그래서, 내 서비스엔?

숫자보다 이게 중요합니다. 용도별로 갈랐습니다.

추천코딩·업무 에이전트

이 모델이 겨냥한 자리 그대로. 에이전트 벤치마크에서 동급 1위이고, 코딩도 상위권 접전. 동급 대비 토큰 단가가 절반 수준이라 하루 종일 돌리는 워크로드일수록 유리합니다.

조건부 추천실시간 챗봇·대화형

기본값 그대로 쓰면 첫 응답 4초 — 체감상 탈락입니다. reasoning_effort를 minimal로 내리면 1.3초대로 살아납니다(아래 실측). 이 설정을 아느냐가 도입 성패를 가릅니다.

비추천최고 품질이 필요한 작업

복잡한 설계 판단, 긴 문서의 정밀한 작성 같은 일은 여전히 플래그십(대형 모델) 몫입니다. Flash 라인은 "많이·빨리"용이지 "가장 잘"용이 아닙니다.

실측: 첫 토큰까지 걸린 시간

발표 자료엔 없는 이야기입니다. 출시 당일 저희 중계 경로에 붙여서 같은 프롬프트로 재봤습니다.

TTFT(첫 토큰까지) — 저희 실측, 동일 프롬프트 기본 설정3.9s reasoning_effort: minimal1.34s

추론(thinking)이 켜진 채 나오는 게 기본값이라 생기는 지연입니다. 배치·에이전트 작업이면 켜두고, 대화형이면 끄세요.

바로 써보기

FutureInfra AI API에서 별도 신청 없이 호출됩니다. 모델명만 바꾸면 기존 코드가 그대로 돕니다.

curl https://futureinfra.ai/v1/ai/chat/completions \
  -H "Authorization: Bearer $FUTUREINFRA_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "google/gemini-3.7-flash",
    "reasoning_effort": "minimal",
    "messages": [{"role": "user", "content": "안녕"}]
  }'

베타 안내 — 아직 결제를 붙이지 않았습니다. 체험 크레딧을 다 쓰셨거나 베타 기간에 더 써보고 싶으시면 이메일만 남겨 주세요. 사람이 직접 확인하고 하루 안에 늘려드립니다.

출처: 9to5Google — 출시 보도 · MarkTechPost — 발표 정리 · explainx — 4개 모델 비교 · TTFT는 자체 실측(2026-08)

연관 서비스

AI 모델 API 써 보기 →300종 이상 모델을 API 키 하나로 — 쓴 만큼만요금 확인하기 →부가세 포함 · 분 단위 · 월 구독 없음

연관 글

Gemini 3.9 Flash 나왔나요? 지금 최신은 3.8 Flash — 3.7과 직접 잰 속도·비용

2026년 9월 22일 기준 Gemini 3.9 Flash는 미출시입니다. 최신 3.8 Flash의 사양·가격(2027년 2배 인상)과, 3.7 Flash와 같은 과제로 직접 잰 속도·비용·JSON 형식 준수 차이를 정리했습니다.

Claude Opus 5.5 — 가격 20% 인하, Opus 5와 직접 잰 속도·비용

클로드 Opus 5.5가 나왔습니다. 값이 20% 내렸고 캐시는 60% 내렸습니다. 이전 모델과 같은 문제를 세 번씩 시켜 비용·시간·형식 준수를 직접 쟀고, 그래프로 정리했습니다. 생각을 끌 수 없다는 주의점도 함께.

AI 이미지 한 장에 얼마? 한글 간판 그려 달라 했더니 — 5개 모델 직접 비교(72원~359원)

제미나이·GPT 이미지 모델 5개에 같은 한글 칠판 그림을 세 번씩 부탁해 한 장 값·걸린 시간·한글 정확도를 비교했어요. 부가세 포함 원화 실측이에요.

도커 호스팅 비용, 작은 앱 한 달 얼마? — 직접 올려 보니 13초·월 5,500원

도커 이미지를 실제로 올려 배포 시간과 한 달·석 달 비용을 쟀어요. Vercel·Cloud Run·Render·Railway·Fly.io 요금과도 나란히 비교했어요(퓨쳐인프라 요금 2026-09-29 기준).

MCP

MCP 는 AI 가 다른 서비스의 기능을 직접 쓰게 해 주는 표준 연결이에요. 동작 순서, Claude Code 에 붙이는 법, 안전하게 쓰는 법과 퓨쳐인프라 MCP 에 직접 연결해 잰 도구 수(30개)·호출 시간(약 0.06초)을 정리했어요.

많이 본 글

  1. 서버 스냅샷이란? 백업과 다른 점, 운영하며 정한 4가지 원칙 스냅샷
  2. 제미나이 API 쓰는 법 — 생각을 낮추면 8배 싸져요(직접 해 봤어요) 제미나이 API
  3. 서버 유지비 한 달 얼마? 방문자 1천·1만·10만 명 기준으로 계산했어요 서버 유지비
  4. AI 모델 무료로 써 보기 — 9개에 같은 질문 했더니 셋은 틀렸어요 무료 AI
  5. 도메인 1년 비용, 첫해 1,800원이 둘째 해 54,000원 되는 이유 — .com·.kr·.shop 값 정리 도메인

댓글 0

  1. 첫 댓글을 남겨 주세요.

← 목록으로