클로드 오퍼스 4.8 (Claude Opus 4.8)
ProductAnnouncements
Claude Opus를 새 버전 Claude Opus 4.8로 업그레이드
Opus 4.7 기반으로 벤치마크 전반 개선
협업 상대자로서 더 효과적
오늘부터 같은 가격으로 제공
Opus 4.8과 함께 새 기능도 여러 개 출시
claude.ai에서 작업에 들일 노력의 양을 사용자가 직접 조절
Claude Code에 매우 큰 규모 문제를 처리하는
dynamic workflows추가Opus 4.8 fast mode는 모델이 2.5배 속도로 일하며, 이전 모델 대비 가격은 3분의 1 수준
Opus 4.8의 성능
아래 표는 코딩, 에이전트 작업, 추론, 실무형 지식 업무 테스트에서 Opus 4.8이 전작 및 다른 모델과 어떻게 비교되는지 보여줌
자세한 내용과 더 넓은 범위의 평가 결과는 Claude Opus 4.8 System Card에서 확인 가능

Opus 4.8과의 협업
초기 테스트 참가자들에 따르면 Claude Opus 4.8은 에이전트 작업에서 더 믿을 만하고, 판단도 더 날카로움
Claude Code에서 적절한 질문을 던지고, 스스로 실수를 잡아내고, 계획이 타당하지 않으면 제동을 걸고, 큰 변경 전에는 복잡한 멀티서비스 탐색에서 충분한 확신을 쌓음
Super-Agent 벤치마크에서는 모든 케이스를 처음부터 끝까지 완주한 유일한 모델
비용을 맞춘 조건에서 이전 Opus 모델과 GPT-5.5를 앞섬
번역, 심층 리서치, 슬라이드 작성, 분석용 에이전트 제품에서 높은 신뢰성 제공
CursorBench에서는 모든 effort 수준에서 이전 Opus 모델을 넘김
tool calling 효율이 뚜렷하게 좋아져 같은 지능 수준을 더 적은 단계로 달성
종단 간 작업을 끝까지 진행함
Legal Agent Benchmark에서 기록상 최고 점수 달성
all-pass 기준으로 전체 10%를 처음 돌파
실질적 법률 업무에서 고객이 실제 변호사 업무를 안심하고 더 많이 맡길 수 있는 정확도 향상으로 이어짐
Opus 4.7 대비 체감 품질 개선 폭이 큼
더 빠르고, 협업하기 쉽고, 긴 세션에서도 맥락과 스타일 지시를 더 잘 유지
목소리, 취향, 기술적 실행을 함께 맞춰야 하는 작업에서 계속 믿고 맡긴 모델
컴퓨터 사용과 브라우저 에이전트 테스트에서도 가장 강력한 모델로 평가
Online-Mind2Web에서 84% 기록
Opus 4.7과 GPT-5.5보다 의미 있게 상승
고객의 에이전트 워크로드가 끝까지 안정적으로 돌아가게 하는 반성적 태도와 집중력 유지
자율 엔지니어링 워크로드에서 필요한 수준으로 도구를 깔끔하게 쓰고 지시를 일관되게 따름
Opus 4.6보다 개선
Opus 4.7에서 보였던 과한 주석과 tool-calling 문제 수정
Devin 위에서 개발하는 엔지니어에게는 성능 향상이 곧바로 더 빠른 역량 확장으로 연결
장기 평가에서는 분석 품질이 이전 Opus 모델보다 꾸준히 높았음
더 빨리 끝냈고, 정보 밀도가 더 높은 결과물 생성
신호 대비 잡음 비율이 눈에 띄게 개선
가장 큰 차이는 분석 입력과 출력의 문제를 선제적으로 표시하는 경향이었고, 다른 모델은 이런 부분을 자주 놓쳐 사용자가 직접 잡아야 했음
CoCounsel Legal 전반에서도 일관성과 추론 품질이 이전 Opus 모델보다 의미 있게 개선
고객이 의존하는 고위험 전문 업무에서는 이런 신뢰성이 핵심
법률·세무 전문가용 수탁자급 AI 시스템을 만드는 과정에서, 실제 워크플로우에서 믿을 수 있는 AI 성능 기준을 끌어올리는 진전
Databricks의 데이터·지식 업무용 AI 에이전트 Genie에서는 기업용 AI의 새 기준을 세웠다고 평가
더 깊고 다단계인 질문을 이전 어떤 Opus보다 빠르게 처리
멀티모달 성능으로 PDF, 다이어그램, 기타 비정형 콘텐츠를 직접 추론 가능
토큰 비용은 Opus 4.7보다 61% 저렴
Hebbia의 금융 문서 워크플로우에서는 Opus 4.7과 같은 강한 품질을 유지하면서 인용 정밀도와 검색 토큰 효율이 더 좋아졌다고 평가
고객이 매일 다루는 조밀한 공시 문서 유형과 특히 잘 맞음
Opus 4.8에서 가장 두드러진 개선 중 하나는 정직성
우리는 모든 모델이 정직하도록 훈련하며, 근거 없는 주장을 피하게 만듦
하지만 AI 모델은 근거가 빈약한데도 일을 진척시켰다고 단정하는 문제가 흔함
초기 테스트 참가자들은 Opus 4.8이 자기 작업의 불확실성을 더 자주 드러내고, 뒷받침되지 않는 주장을 덜 한다고 보고
우리 평가에서도 확인됐고, Opus 4.8은 전작보다 자신이 작성한 코드의 결함을 아무 말 없이 넘길 가능성이 약 4배 낮음
출시 전에는 늘 그렇듯 상세한 alignment 평가를 수행
긍정적 특성 측면에서 Alignment 팀은 Opus 4.8이 "사용자 자율성 지원, 사용자의 최선 이익에 맞춰 행동하기 같은 친사회적 특성 지표에서 새로운 최고치"에 도달했다고 판단
deception이나 오남용 협조 같은 misaligned behavior 비율도 Opus 4.7보다 크게 낮았고, 정렬 수준이 가장 좋은 모델인 Claude Mythos Preview와 비슷했음
전체 alignment 평가와 배포 전 안전성 테스트 묶음은 Claude Opus 4.8 System Card에 수록

오늘 함께 출시되는 항목
Dynamic workflows
research preview로 제공되는 새 기능
Claude Code에서 Claude가 더 큰 작업을 맡도록 확장
단일 세션 안에서 작업 계획을 세우고 수백 개의 병렬 서브에이전트를 실행 가능
Opus 4.8에서는 이 에이전트들이 더 오래 실행될 수 있음
사용자에게 보고하기 전에 결과를 검증
예를 들어 Opus 4.8이 붙은 Claude Code는 기존 테스트 스위트를 기준선으로 삼아 수십만 줄 규모 코드베이스 마이그레이션을 시작부터 머지까지 수행 가능
Claude Code Enterprise, Team, Max 플랜에서 제공되며 자세한 내용은 이 글 참고
claude.ai와 Cowork의 effort control
모델 선택기 옆 새 제어 항목으로 응답에 들일 노력의 양 선택 가능
높은 effort 설정에서는 Claude가 더 자주, 더 깊게 생각해 더 나은 응답 제공
낮은 effort 설정에서는 더 빨리 응답하고 사용자의 rate limit도 더 천천히 소모
이제 모든 플랜에서 선택 가능
Messages API가 이제 messages 배열 내부의 system entry를 받음
개발자는 prompt cache를 깨뜨리지 않고, 업데이트를 user turn으로 우회시키지 않아도 작업 도중 Claude의 지시를 바꿀 수 있음
에이전트가 실행 중일 때 권한, 토큰 예산, 환경 맥락을 갱신하는 용도로 활용 가능
추론 설정
Opus 4.8의 기본값은 high effort
품질과 사용자 경험의 균형이 가장 좋다고 판단
코딩 작업에서는 이 effort 수준이 Opus 4.7 기본값과 비슷한 수의 토큰을 쓰면서도 성능은 더 좋음
사용자는
"extra"(Claude Code에서는xhigh)나"max"를 선택할 수 있음더 많은 토큰을 써서 결과를 더 끌어올림
어려운 작업과 오래 도는 비동기 워크플로우에는
extra권장
높은 effort 단계의 토큰 사용량 증가를 감안해 Claude Code rate limit도 상향
사용자는 자기 프로젝트에 맞는 수준을 고르면 됨
다음 단계
사용자는 Opus 4.8에서 전작 대비 크지는 않지만 분명한 개선을 체감하게 될 것
아직 할 일은 남아 있음
Opus와 비슷한 역량을 더 낮은 비용으로 제공하는 모델을 개발하고 출시하는 중
Opus보다 지능이 더 높은 새 모델 계열도 출시할 계획
Project Glasswing의 일부로, 현재 소수 조직이 사이버보안 업무에 Claude Mythos Preview를 사용 중
이 수준의 모델은 일반 공개 전 더 강한 사이버 안전장치가 필요
우리는 그 안전장치를 빠르게 개발하고 있으며, 앞으로 몇 주 안에 Mythos급 모델을 모든 고객에게 제공할 수 있을 것으로 예상
제공 범위
Claude Opus 4.8은 오늘부터 모든 지역에서 사용 가능
일반 사용 가격은 Opus 4.7과 동일
입력 토큰 100만 개당 5달러
출력 토큰 100만 개당 25달러
fast mode 가격
입력 토큰 100만 개당 10달러
출력 토큰 100만 개당 50달러
개발자는 Claude API에서
claude-opus-4-8사용 가능
각주
Terminal-Bench 2.1
모든 모델 점수는 Terminus-2 공개 하네스로 보고
GPT-5.5의 Codex CLI 하네스 기준 보고 점수는 83.4%
OSWorld-Verified
실제 환경 성능을 더 정확히 반영하도록 OSWorld-Verified 평가 실행 방식을 변경
Opus 4.7 점수도 82.3%로 업데이트
자세한 변경 내용은 System Card 참고
Finance Agent v2
Gemini 3.5 Flash는 Finance Agent v2에서 57.9% 기록
Gemini 3.1 Pro보다 큰 폭 개선
source https://www.anthropic.com/news/claude-opus-4-8
HN 댓글에서는 버전이 4.5에서 4.8까지 올라오는 동안 코딩할 때 체감 차이가 얼마나 있었는지가 첫 쟁점이었다. 4.6과 4.7의 차이를 뚜렷하게 말하기 어렵고, 생산성 향상도 모델 자체보다 긴 컨텍스트와 에이전트 도구 개선에서 왔다는 경험담이 반복됐다.
긴 작업에서는 4.7이 4.6보다 덜 이상해지지 않는다는 의견이 있었지만, 짧거나 요구사항이 모호한 작업에서는 말만 길어지고 판단은 더 둔해졌다는 지적도 나왔다. 같은 모델이라도 작업 길이와 지시의 구체성에 따라 장단점이 갈린다는 뜻이다.
초대형 프런티어 모델을 계속 키워야 하느냐를 두고는 의견이 크게 갈렸다. 작은 모델도 구조 개선, 합성 데이터, 추론 강화, 더 나은 컨텍스트 관리가 더해지면 코딩에서는 빠르게 따라올 수 있다는 기대가 있었고, 비싼 대형 모델은 작은 모델을 만드는 교사 역할로 남을 수 있다는 추정도 나왔다.
작은 모델 낙관론에는 곧바로 제약 조건이 따라붙었다. 드문 기술 정보나 한 번만 정리된 블로그 글, 깃허브 이슈, PDF를 찾아야 하는 일에서는 파라미터가 작은 모델이 더 취약할 수 있고, 실제 개발에서는 코드 문법보다 문제를 제대로 해석하고 엉뚱한 우회책을 버리는 능력이 더 중요하다는 반박이 많았다.
벤치마크 숫자만으로 코딩 능력을 말하기 어렵다는 사례도 구체적으로 나왔다. 가려진 이미지를 원본으로 되돌려 분석하려 하거나, 모델 다운로드에 실패하자 랜덤 가중치로 추론을 돌리는 식의 행동은 코드를 쓰는 능력과 별개로 작업 목표를 잘못 이해한 경우로 받아들여졌다.
쟁점은 새 모델이 한 번 더 나왔느냐보다 지금 모델을 어떤 작업 흐름에 얹어 쓰느냐로 옮겨갔다. 계획 모드, 긴 문맥, 스킬 축적, 사람의 검토 절차를 갖추면 지금 모델로도 맡길 수 있는 일이 크게 늘어나고, 비용을 따질 때도 많은 개발자는 최고 성능보다 저렴한 토큰과 충분히 쓸 만한 로컬 모델을 더 먼저 따질 것이라는 쪽이 더 설득력 있었다.
