Claude Opus 5 소개 \ Anthropic
Claude Opus 5는 Fable 5의 최전선급 지능에 근접하면서 가격은 절반인, 신중하고 선제적으로 행동하는 모델
Frontier-Bench, GDPval-AA 등 코딩·지식 작업 평가에서 새로운 최고 성능을 기록했지만, 사이버보안 작업에서는 Mythos 5에 뒤처짐
다른 모델보다 효율적으로 작동하도록 설계했으며 Claude Max의 새 기본 모델이자 Claude Pro에서 가장 강력한 모델로 제공함

성능과 비용 효율성
Opus 4.8과 같은 비용으로 성능을 크게 높였으며, effort 설정을 조절해 지능과 토큰·속도·비용 사이에서 최적화 가능
Frontier-Bench v0.1에서는 모든 모델을 앞섰고 작업당 비용을 낮추면서 Opus 4.8 성능의 2배 이상을 달성함
mini-SWE-agent 하네스와 GKE 백엔드를 사용한 내부 실행 결과로, 작업별 5회 시도의 평균 보상임
Opus 5와 Fable 5가 안전 분류기 때문에 요청을 거부하면 Opus 4.8을 폴백으로 사용함
CursorBench 3.2에서는 max effort 기준 Fable 5 최고 점수와 0.5% 이내 차이였고, 작업당 비용은 절반 수준
high·xhigh·max effort 모두 같은 비용에서 다른 모든 모델보다 높은 성능을 냄



새로운 문제 해결과 지식 작업에서도 비용 대비 최고 수준의 결과를 기록
ARC-AGI 3 점수는 차상위 모델의 3배
처음부터 끝까지 비즈니스 작업을 수행하는 능력을 측정하는 Zapier AutomationBench에서는 같은 작업당 비용으로 차상위 모델 대비 약 1.5배의 통과율을 보임
가장 낮은 effort에서도 다른 모든 모델보다 많은 작업을 통과함
컴퓨터 사용 벤치마크 OSWorld 2.0에서는 어떤 비용 구간에서도 모든 모델을 앞섰고, Fable 5의 최고 결과를 비용의 3분의 1을 조금 넘는 수준에서 넘어섬
GDPval-AA v2·HLE·DeepSearchQA를 비롯한 관련 평가에서도 최고 성능과 비용 효율을 기록함






과학 연구에서는 모든 생명과학 평가에서 Opus 4.8보다 높은 성능을 보임
구조생물학·유기화학·생물정보학을 포괄하며, 개선 폭은 유기화학과 단백질 관련 작업에서 특히 컸음
분광학 데이터로 분자 구조를 추론하는 내부 벤치마크에서 Opus 4.8보다 10.2%포인트 높음
단백질 서열 변이가 기능에 미치는 영향을 예측하는 작업에서는 7.7%포인트 상승
시각 결과물 생성 능력도 크게 강화
공기역학적·비공기역학적 물체 위로 흐르는 공기를 시각화하고, 단순화된 대화형 세포 그림을 제작함
Claude Opus 5와 작업하기
자체 검증과 반복 수행 능력이 강화돼 어려운 작업을 끝까지 해결
기계 부품 도면을 직접 볼 수 없는 Frontier-Bench 작업에서 원시 픽셀로부터 형상을 추출하는 컴퓨터 비전 파이프라인을 직접 작성한 뒤, 완전한 3D FreeCAD 모델을 반복적으로 재구성함
같은 조건의 경쟁 모델은 5번 시도해도 해결하지 못함
인기 오픈소스 패키지 관리자의 실제 버그에서 근본 원인을 찾고 커뮤니티 패치가 놓친 엣지 케이스까지 수정함
경쟁 모델은 표면 증상만 고친 뒤 해결됐다고 보고함
새 거래소용 시장 데이터 피드를 한 세션에 구축했으며, 검증할 라이브 피드가 없자 자체 테스트 하네스를 만들어 데이터 파싱을 확인함
이전 모델은 엔지니어가 상세한 계획을 제공해도 작업을 완료하지 못했음

FrontierCode 1.1에서는 절반의 비용으로 Fable급 성능에 접근
Devin 안에서도 어려운 디버깅과 근본 원인 분석에 특히 강함

CursorBench에서는 Fable 5 바로 아래 성능을 기록하면서 Opus 수준의 속도와 비용을 유지
Fable 5와 유사한 행동 특성을 다수 보임

Zapier AutomationBench에서 이전 Claude 모델보다 토큰을 더 쓰지 않고 1위에 오름
원시 계정 상태 워크북에서 위험 계정 식별, 담당자 알림, 리텐션 운영용 요약까지 이탈 방지 절차 전체를 수행해 100%를 기록함
이전 모델은 이 작업을 통과하지 못했음

유전체 분석에서는 적절한 통계 검정으로 교란 요인을 배제하고 독립적인 방법으로 결과를 교차 확인
긴 다단계 분석에서도 흐름을 잃지 않는 신중함을 보임

내부 평가에서 같은 계열의 모든 모델을 앞섰고, 가장 어려운 에이전트형 코딩 작업은 Opus 4.7보다 22% 향상
실행별 편차도 크게 줄어 반복 빌드의 일관성이 높아짐

Opus 4.5 이후 Opus 제품군에서 가장 큰 도약
동일한 풀스택 앱 구축 작업에서 애니메이션·게임·3D를 포함한 프런트엔드 결과물이 기존 Opus 모델 중 가장 뛰어났음

개방형 분석 작업에서는 Opus 4.8을 전반적으로 능가하며, 어렵고 모호한 작업일수록 개선 폭이 큼
답변이 더 명확하고 간결해졌고 높은 effort에서도 효율이 향상됨

일상적인 금융 리서치에서 수치 추론·표 작업·비판적 사고가 개선
정밀성이 중요한 작업에서 Opus 4.8보다 뚜렷하게 나은 결과를 냄

전문 기업 콘텐츠 분석에서 Opus 4.8보다 전체 성능이 8% 높음
기술·의료·공공 부문이 사용하는 데이터 분석 워크플로는 11%, 실사 워크플로는 17% 개선됨

개발 환경에서 비서실장 역할을 맡겨도 자체 모니터를 구축하고 각 시스템을 운영
사람의 판단이 필요한 사안에만 개입을 요청함

Fundamental Research Assistant 코드베이스 전반의 대규모 변경을 수행
에이전트형 워크플로 전 과정에서 피드백에 적응하고, 기존 모델보다 추론을 명확히 설명하면서 평소 여러 조각으로 나눌 작업을 한 번에 처리함

어려운 금융 모델링 작업에서 정확도와 효율이 모두 Opus 4.8보다 향상
effort 전 구간 평균 정확도가 9%포인트 높았고, 턴과 도구 호출은 3분의 1 적었으며 소요 시간은 60% 감소함
심층 금융 도메인 논리가 필요한 작업에서 최소 성능 수준도 실질적으로 높아짐

실제 프런트엔드 개발자처럼 브라우저에서 결과물을 자체 검사하고 수정
데스크톱·모바일 너비로 페이지를 열어 모바일 화면 아래에 숨은 제품과 화면 밖으로 벗어난 결제 버튼을 찾아 인계 전에 모두 고침

법률 에이전트 작업에서는 이전 Opus 모델을 앞섰고 기업 지배구조·중재 분야의 향상이 특히 큼
낮은 추론 수준에서도 품질을 유지했으며, Opus 4.8의 max reasoning과 비슷한 성능을 내면서 평균 생성 토큰은 26% 적었음

전체 프레젠테이션 자료를 만들고 수정하는 장기 작업에서 큰 개선을 보임
시각적 이해와 서식이 좋아지고 슬라이드 문제가 줄어 결과물 품질이 뚜렷하게 상승

PR을 인계할 때 바로 게시하지 않고 브랜치·템플릿·테스트 영향을 먼저 확인
이전 모델이 앞서 진행하다 검사 단계에서 막히던 문제를 줄여 더 깔끔하게 인계함

재설계 과정에서 제안의 장점과 결함을 분리해 판단하고 타협안을 제시
반대 의견을 강하게 재촉해도 철회하지 않고 이견을 하나의 설계 질문으로 좁힌 뒤, 장점은 유지하면서 결함을 고치는 방안을 내놓음

첫 번째 턴의 계약서 레드라인 평가에서 테스트한 모델 중 최고 점수를 기록
Opus 4.8의 거의 2배였으며, NDA에서는 정확도를 유지하거나 높이면서 더 적은 시간과 검토 횟수로 레드라인에 도달함

죽은 코드 없이 간결한 diff를 작성하고 코드베이스 특유의 미묘한 위험을 더 잘 포착
프로덕션 워크로드에 도입할 수준의 결과를 보임

통합 에이전트 플랫폼 Cosmos의 여러 사용 사례를 Opus 5로 이전할 예정
코드 리뷰에서도 Opus 4.8보다 Opus 5 사용을 선호함

코드를 쓰기 전에 더 깊이 검토하고 계획 단계에서 자체 논리 오류를 발견
단순히 작동 여부만 보지 않고 답이 옳은 이유까지 추론하며, JetBrains IDE 도입이 기대될 만큼 문제 해결 능력이 크게 향상됨

트레이딩 벤치마크에서 테스트한 Opus 모델 중 가장 강력한 성능을 기록
Opus 4.8 대비 추론 토큰은 약 7분의 1, 지연 시간은 절반 미만으로 줄이면서 더 나은 답을 냄
정렬과 안전성
배포 전 자동 행동 감사에서 지금까지 가장 높은 정렬 수준을 기록함
Claude의 헌법을 Opus 4.8·Sonnet 5·Fable 5보다 잘 준수하고, 기만적 행동과 오용 유도에 넘어가는 비율이 가장 낮았음
되돌리기 어려운 부작용을 낳을 수 있는 무모한 행동도 가장 잘 피함

자동 행동 감사의 전체 비정렬 행동 점수는 2.3으로 최근 모델 중 가장 낮음
위험한 이중용도 역량의 최전선을 확장하지 않음
민간·정부 파트너와 함께 수행한 엄격한 평가에서 생물학 연구와 공격적 사이버보안 모두 Mythos 5보다 뒤처졌으며, 세부 내용은 System Card에 공개함
Opus 4.8과 마찬가지로 사이버 작업을 의도적으로 학습시키지 않았지만, 일반 역량이 높아지면서 사이버 성능도 크게 개선됨
취약점 발견은 Mythos 5에 근접했으나, 취약점을 실질적인 사이버 위협으로 전환하는 익스플로잇 개발은 상당히 뒤처짐
사람의 광범위한 안내 없이 취약점을 찾고 악용하는 능력을 측정하는 OSS-Fuzz에서도 두 모델의 취약점 발견 성공률은 비슷했지만 Opus 5의 익스플로잇 개발 점수는 훨씬 낮았음

OSS-Fuzz에서 소프트웨어 취약점 식별은 Mythos 5에 근접하지만 익스플로잇 개발 성공률은 크게 낮음
보호 장치
사이버보안·생물학의 유익한 활용을 허용하도록 Opus 4.8과 유사한 보호 장치를 적용
일부 제한적인 사이버 작업에는 더 강한 가드레일을 추가함
사이버 분류기는 Fable 5보다 비례적으로 덜 제한적
소스 코드에서 취약점을 찾는 작업은 허용하지만, 악의적 행위자와 연관될 가능성이 더 큰 바이너리 기반 취약점 스캔·침투 테스트·익스플로잇 생성을 차단함
분류기의 개입 빈도는 테스트 기준 Fable 5보다 약 85% 낮을 것으로 예상
Claude.ai, Claude Code, Claude Cowork에서 표시된 요청은 기본적으로 Opus 4.8로 폴백됨
API에서도 Opus 4.8 폴백을 활성화할 수 있음
Cyber Verification Program(CVP)은 보호 장치로 제약받을 사이버보안 작업을 지원함
CVP에 이미 참여한 기업과 연구자는 보안 제한을 줄인 Opus 5에 즉시 접근 가능
Opus 5는 일반에 제공되는 과학 연구 모델 중 가장 강력하지만, 장시간 자율 연구에는 중요한 한계가 있음
이런 장기 자율 작업에서 생물학 관련 위험이 가장 커질 것으로 예상하며, 해당 유형의 생물학 작업은 Mythos 5가 더 강함
Fable 5에서 차단되는 생물학 관련 요청은 이제 Opus 4.8 대신 Opus 5로 라우팅됨
이용 방법과 가격
모든 플랫폼에서 즉시 제공하며 Opus 4.8과 같은 가격을 적용
입력 토큰 100만 개당 $5, 출력 토큰 100만 개당 $25
개발자는 Claude API에서
claude-opus-5로 시작 가능일반 접근에는 이전 Opus 모델과 마찬가지로 데이터 보존 요건이 없음
Fast mode는 기본 속도의 약 2.5배로 실행
Claude Platform에서는 Opus 5 기본 가격의 2배이며, Claude Code에서는 usage credits로 이용 가능
두 가지 기능을 베타로 함께 공개
Claude Platform의 대화 도중 도구 변경을 사용하면 prompt cache를 무효화하지 않고 대화 중 Claude가 쓸 수 있는 도구를 바꿀 수 있음
API의 자동 폴백을 활성화하면 Opus 5 또는 Fable 5에서 안전 분류기에 표시된 요청을 다른 모델로 자동 라우팅 가능
요청을 차단하는 대신 기본적으로 사용 가능한 최적의 모델로 전달함
활용 방법은 프롬프팅 가이드에서 확인 가능
source https://www.anthropic.com/news/claude-opus-5
HN에서는 Opus 5의 절대 성능보다 Fable 5와의 관계가 더 큰 관심을 끌었다. 여러 평가에서 Fable 5와 비슷하거나 앞선 수치를 보이면서도 가격은 더 낮고, 일반 이용 시 30일 데이터 보관 의무도 없다는 점이 핵심이다. 반면 Anthropic은 Opus 5가 전반적으로 Fable 5보다 뛰어나지는 않다고 설명해 두 모델을 어떤 작업에 써야 하는지 오히려 모호해졌다는 반응이 이어졌다.
벤치마크 수치는 기대와 경계를 함께 불렀다. ARC-AGI-3의 30%는 큰 도약으로 받아들여졌지만, 실제 지능 향상을 뜻하는지 평가 자체의 한계가 드러난 것인지는 판단을 유보해야 한다는 지적도 나왔다. OSWorld 2.0의 21%와 55%대 수치 차이는 완수율과 부분 점수를 혼동한 데서 비롯됐다. 같은 결과도 어떤 지표를 앞세우느냐에 따라 인상이 크게 달라지므로, 서로 다른 문서의 숫자를 그대로 비교해서는 안 된다는 사례다.
실무에서는 작업당 비용과 제약이 선택을 가른다. 짧고 명확한 작업에서는 Fable의 비용이 두 배 가까이 들면서 결과 차이는 크지 않았다는 경험이 있었고, Opus 5가 추측을 피하고 관찰한 사실만 답한다는 긍정적 평가도 나왔다. 다만 응답이 길어져 토큰 효율이 떨어질 수 있고, 추론 강도를 높인다고 항상 성능이 좋아지는 것도 아니었다. 소스 코드 취약점 탐지는 허용하면서 바이너리 분석과 침투 테스트는 막는 보안 정책, 의료 용어가 포함된 코드에서 발생한 과도한 거부도 실제 도입에 영향을 준다.
결국 모델 선택은 최고 점수 하나로 끝나지 않는다. 데이터 보관 조건과 구독 포함 여부, 작업당 비용, 컨텍스트 길이, 거부 정책을 먼저 확인해야 한다. 빠른 출시와 폐기 주기, 불안정한 서비스 환경까지 고려하면 특정 모델에 고정하기보다 실제 업무로 회귀 테스트를 마련하고 필요에 따라 모델을 바꿀 수 있게 설계하는 편이 현실적이다.
