Claude Opus 5.5 — 가격 20% 인하, Opus 5와 직접 잰 속도·비용
클로드 Opus 5.5가 나왔습니다. 값이 20% 내렸고 캐시는 60% 내렸습니다. 이전 모델과 같은 문제를 세 번씩 시켜 비용·시간·형식 준수를 직접 쟀고, 그래프로 정리했습니다. 생각을 끌 수 없다는 주의점도 함께.
목차 보기
2026년 9월 22일, 클로드(Claude)의 상위 모델 Opus 5.5가 나왔습니다. 이번 발표에서 제일 눈에 띈 건 성능이 아니라 가격이었습니다. 값이 20% 내렸거든요. 저희는 여러 AI 모델을 대신 불러 주는 서비스를 운영합니다. 그래서 나온 다음 날 아침, 이전 모델인 Opus 5와 새 모델 5.5에 똑같은 문제를 세 번씩 시켜 봤습니다. 아래 숫자는 전부 그때 실제로 나온 값입니다.
읽기 전에 알아 두면 좋은 말 3개
- 토큰 — AI가 글을 세는 단위입니다. 한글 한 글자가 대략 토큰 하나라고 생각하시면 됩니다. AI 요금은 "주고받은 글의 양"으로 매겨집니다.
- 캐시 — 매번 똑같이 보내는 앞부분(예: "너는 친절한 상담원이야" 같은 긴 지침)을 미리 저장해 두는 것입니다. 저장해 두면 같은 내용을 다시 보낼 때 훨씬 싸집니다.
- 확장 사고 — AI가 답을 쓰기 전에 혼자 생각하는 과정입니다. 답이 정확해지지만, 생각한 양도 요금에 포함됩니다.
Opus 가격은 1년 사이 얼마나 내렸나요?
Opus는 클로드의 상위 등급입니다. 값이 비싸서 "중요한 일에만 쓰는 모델"이었는데, 1년 사이에 값이 많이 내렸습니다.
13개월 만에 출력 단가가 73% 내렸습니다. 같은 작업을 작년 가격으로 돌렸다면 지금의 약 3.75배를 냈다는 뜻입니다.
표로 보기
| 모델 | 공개 | 입력(100만 토큰) | 출력(100만 토큰) | 컨텍스트 |
|---|---|---|---|---|
| Opus 4.1 | 2025-08 | $15 | $75 | 20만 |
| Opus 4.5 | 2025-11 | $5 | $25 | 20만 |
| Opus 4.6~5 | 2026-02~07 | $5 | $25 | 100만 |
| Opus 5.5 | 2026-09 | $4 | $20 | 100만 |
쉽게 말하면 이렇습니다. 작년 8월에 만 원 내고 시키던 일을, 지금은 2,700원쯤이면 시킬 수 있습니다. "비싸니까 웬만하면 싼 모델로 하자"고 정해 두셨다면, 이제 다시 계산해 볼 만합니다.
Opus 5.5 가격표 — 한눈에
| 100만 토큰당(USD) | Opus 5.5 | Opus 5 | 차이 |
|---|---|---|---|
| 입력 | $4 | $5 | −20% |
| 출력(사고 토큰 포함) | $20 | $25 | −20% |
| 캐시 읽기 | $0.20 | $0.50 | −60% |
| 배치(입력/출력) | $2 / $10 | $2.5 / $12.5 | −20% |
컨텍스트 100만 토큰 · 최대 출력 12만 8천 토큰 · 지식 기준 시점 2026년 6월. 빠른 응답용 Fast 모드는 $8 / $40로 따로 책정돼 있습니다.
표에서 가장 크게 내린 건 캐시 읽기입니다. 60% 쌉니다. 챗봇을 만들 때는 보통 "너는 이런 회사의 상담원이고, 규칙은 이렇고…" 하는 긴 설명을 질문마다 같이 보냅니다. 이 부분을 캐시에 저장해 두면, 다시 보낼 때 값이 20분의 1로 떨어집니다. 질문이 많은 서비스일수록 차이가 큽니다.
직접 재 봤습니다. 어떻게 쟀나요?
회사가 발표한 숫자는 그 회사가 직접 잰 값입니다. 그래서 저희가 따로 재 봤습니다. 실제로 요금이 나가는 방식 그대로 요청을 보내고, 응답에 찍혀 오는 실제 청구 금액을 그대로 적었습니다. 방법은 이렇습니다.
- 시킨 일 세 가지: ① 일부러 틀리게 만든 프로그램 코드에서 잘못된 곳 찾아 고치기 ② 문장 하나에서 이름·전화번호·요청 내용을 표 형태로 뽑아내기 ③ 한국어 네 문장을 세 문장으로 줄이기
- 반복: 모델별·과제별 3회, 중간값 사용
- 조건: 설정은 기본값 그대로 두고, 답의 최대 길이만 제한했습니다. 두 모델에 똑같이 맞췄습니다.
- 측정 시각·위치: 2026-09-23 오전 8시 56분(KST) 무렵, 서울
세 과제 모두 5.5가 쌌습니다. 버그 찾기는 −36%, JSON 추출 −20%, 요약 −19%.
표로 보기 — 첫 글자까지·출력 토큰 포함
| 과제 | 모델 | 첫 글자까지 | 전체 응답 | 출력 토큰 | 1회 비용 |
|---|---|---|---|---|---|
| 버그 찾기 | Opus 5 | 6.82초 | 7.13초 | 385 | $0.01035 |
| Opus 5.5 | 5.64초 | 5.69초 | 302 | $0.00662 | |
| JSON 추출 | Opus 5 | 1.15초 | 3.71초 | 70 | $0.00232 |
| Opus 5.5 | 2.73초 | 2.97초 | 70 | $0.00186 | |
| 한국어 요약 | Opus 5 | 1.87초 | 4.15초 | 205 | $0.00602 |
| Opus 5.5 | 3.75초 | 3.78초 | 209 | $0.00490 |
첫 글자가 나오기까지는 5.5가 더 걸린 과제도 있었지만(먼저 생각하고 답을 씁니다), 끝까지 받는 시간은 세 과제 모두 5.5가 빨랐습니다.
시키는 대로 답할까요?
사람을 제일 귀찮게 하는 건 속도가 아닙니다. 답의 모양이 매번 달라지는 것입니다. 프로그램이 답을 자동으로 읽어야 하는데 모양이 바뀌면 오류가 납니다. 그래서 "설명은 빼고 자료만 딱 주세요"라고 세 번씩 시켜 봤습니다.
| 모델 | 순수 JSON | 코드블록으로 감쌈 |
|---|---|---|
| Opus 5 | 0회 | 3회 |
| Opus 5.5 | 2회 | 1회 |
5.5가 더 잘 지켰습니다. 하지만 완벽하지는 않았습니다. 세 번 중 한 번은 여전히 설명을 덧붙였습니다. 그러니 프로그램은 두 경우를 모두 받아들이도록 짜 두는 게 안전합니다. 아래처럼 군더더기를 떼어 내고 읽으면 됩니다.
// 코드블록으로 감싸 와도 읽히게 const raw = reply.trim().replace(/^```(?:json)?\s*|\s*```$/g, ""); const data = JSON.parse(raw);
정확도는 어땠을까요. 아래 함수의 버그를 찾는 과제였습니다.
function avg(xs) {
let s = 0;
for (let i = 1; i <= xs.length; i++) { s += xs[i]; } // 여기
return s / xs.length;
}
숫자들의 평균을 구하는 코드인데, 세는 순서가 하나씩 밀려 있습니다. 그래서 첫 번째 숫자를 빼먹고, 있지도 않은 칸을 더합니다. 결과는 "숫자가 아님"이 되어 버립니다. 사람도 자주 하는 실수입니다. 두 모델 모두 세 번 다 정확히 찾아내고 고쳤습니다. 이 정도 문제에서는 차이가 없었습니다.
공식 벤치마크는 얼마나 올랐나요?
널리 쓰이는 SWE-bench Verified 수치는 이번 발표에 없습니다. 벤치마크는 모델 제작사가 잰 값이라, 아래 실측과 함께 보시는 편이 안전합니다.
점수가 가장 많이 오른 두 가지는 컴퓨터를 직접 다루는 일과 코드를 고치는 일입니다(52.3 → 66.4, 46.6 → 57.8). 둘 다 "한 번 시키면 AI가 알아서 여러 단계를 밟아 끝내는" 일입니다. AI에게 코딩을 맡기는 분들이 가장 크게 느낄 부분입니다. 실제로 클로드 코드(Claude Code) 프로그램도 최신 버전부터 기본 모델을 5.5로 바꿨습니다.
Fable과는 어떻게 다른가요?
클로드에는 Opus 위에 Fable 등급도 있습니다. 가장 최근 모델인 Fable 5.1(2026년 9월 1일)은 100만 토큰당 입력 $10·출력 $50으로, Opus 5.5보다 2.5배 비쌉니다. 그런데 이번 발표 벤치마크에서는 오히려 Opus 5.5가 Fable 5.1보다 점수가 높았습니다(터미널 작업 66.4 대 55.8, 에디터 작업 57.8 대 51.8). 값이 싼 새 모델이 비싼 모델을 앞선 셈입니다. 다만 벤치마크 몇 개로 모델 전체를 판단할 수는 없습니다. 맡길 일이 정해져 있다면 두 모델에 같은 일을 시켜 비교해 보세요.
각 벤치마크가 무엇을 재는지는 공식 사이트에서 볼 수 있습니다. Terminal-Bench(터미널에서 여러 단계 작업), OSWorld(실제 컴퓨터 화면 조작), HLE(전문가도 어려워하는 시험 문제). CursorBench는 코드 편집기 회사 Cursor가 만든 평가입니다. 점수 원문은 Anthropic 발표에 있습니다.
다만 벤치마크는 학교 시험 점수와 비슷합니다. 점수가 높다고 모든 일을 잘한다는 뜻은 아닙니다. 그래서 위의 실제 측정과 같이 보셔야 합니다.
옮기기 전에 무엇을 확인해야 하나요?
- 기본 생각 깊이가 낮아졌습니다. 예전 모델은 "깊게"가 기본이었는데, 새 모델은 "보통"이 기본입니다. 같은 걸 물었는데 답이 짧아졌다면 이 때문입니다. 필요하면 깊게로 올릴 수 있습니다.
- "이 도구를 꼭 써라"라고 강제하던 방식이 막혔습니다. 그렇게 짜 둔 프로그램은 오류가 나므로 고쳐야 합니다.
- 예전 모델도 당장 없어지지 않습니다. 공식 문서상 2027년 7월까지는 그대로 쓸 수 있습니다. 서두르지 않아도 됩니다.
- 첫 글자가 조금 늦게 나올 수 있습니다. 먼저 생각하고 쓰기 때문입니다. 채팅창처럼 글자가 흘러나오는 화면이라면 직접 느낌을 확인해 보세요.
그래서 지금 옮길까요?
상황별 판단
- AI에게 코딩을 맡기고 있다 → 옮기세요. 같은 일이 더 싸고 빨리 끝났습니다. 점수도 이 부분이 가장 많이 올랐습니다.
- 아주 짧은 답을 엄청 많이 뽑는다 → 먼저 시험해 보세요. 생각하는 양 때문에 값이 예상보다 나올 수 있습니다.
- 긴 설명을 매번 같이 보낸다 → 캐시를 켜세요. 값이 60% 내려서 효과가 가장 큽니다.
- 당장 바꾸기 어렵다 → 예전 모델도 당분간 쓸 수 있습니다. 다만 같은 일에 25% 더 내고 있는 셈입니다.
이 글의 숫자는 어디서 왔나요?
이 글의 숫자 출처
- 실측(비용·시간·형식): 저희가 2026-09-23 08시 56분(KST) 무렵 서울에서 보낸 실제 API 호출 18건(모델 2 × 과제 3 × 3회). 비용은 응답에 함께 오는 청구액(usage.cost)을 그대로 적었고, 시간은 요청 시작부터 첫 조각·마지막 조각까지를 쟀습니다.
- 가격·컨텍스트·변경점: Anthropic 공식 발표와 문서(2026-09-22 게시, 2026-09-23 확인).
- 벤치마크 점수: Anthropic 공식 발표에 실린 수치(제작사 자체 측정).
- 가격 변화 추이: 모델 중계 서비스 OpenRouter의 공개 모델 목록에서 Opus 계열의 공개 날짜와 단가를 읽어 정리(2026-09-23 조회).
재현 방법 — 실제로 보낸 요청
curl https://openrouter.ai/api/v1/chat/completions \
-H "Authorization: Bearer $KEY" -H "Content-Type: application/json" \
-d '{"model":"anthropic/claude-opus-5.5","stream":true,"max_tokens":1200,
"usage":{"include":true},
"messages":[{"role":"user","content":"(아래 프롬프트)"}]}'
- 버그 찾기: "다음 자바스크립트 함수에는 버그가 하나 있습니다. 무엇이 문제이고 어떻게 고쳐야 하는지 한국어로 3문장 이내로 답하고, 고친 코드만 덧붙이세요." + 위 함수
- JSON 추출: "다음 문장에서 이름, 전화번호, 요청사항을 JSON 으로만 출력하세요(설명 없이). '안녕하세요 김민수입니다. 010-1234-5678 로 연락 주시고, 다음 주 화요일에 서버 두 대 견적 부탁드립니다.'"
- 요약: "다음 내용을 한국어 3문장으로 요약하세요: 서버 스냅샷은 특정 시점의 디스크 상태를 저장해 되돌리는 기능이다. …"
- 작성: 서순명(퓨쳐인프라 서비스 기획) · 작성일 2026년 9월 23일
- 측정의 한계: 과제당 3회, 한 시간대, 서울 한 곳에서 잰 값입니다. 시간대·요청 내용에 따라 달라질 수 있고, 정답 판정은 이 코드 수정이 맞았는지만 본 것이라 긴 작업의 품질을 대표하지 않습니다.
- 이해관계: 퓨쳐인프라는 AI 모델 API를 중계하는 회사이며, 이 글에 자사 서비스 안내가 들어 있습니다. 측정은 어느 모델이 유리하도록 조정하지 않았고, 같은 조건으로 돌렸습니다.
- 참고: Anthropic 발표 · Opus 5.5 변경점 · 이전 가이드 · 가격 문서 · 지원 종료 일정
댓글 0
로그인하면 댓글을 남길 수 있습니다.