GPT-5.6으로 가격 대비 성능의 한계를 한 단계 더 확장
가격 인하와 API 고속 처리 옵션을 함께 제공함
전날 GPT‑5.6이 스스로의 실행 효율을 높인 과정을 공개한 데 이어, 그 성과를 가격과 속도 개선으로 고객에게 돌려줌
GPT‑5.6 Luna는 오늘부터 80%
GPT‑5.6 Terra는 20% 저렴해짐
Codex와 ChatGPT Work의 유료 구독에서도 Terra와 Luna 사용량에 차감되는 크레딧이 줄어듦
Luna는 도구 사용과 다단계 워크플로 완료가 가능해, 높은 품질이 필요한 대량 작업을 더 경제적으로 확장할 수 있음
API의 Priority Processing은 Fast mode로 대체됨
GPT‑5.6 Sol에서 지능 수준은 그대로 유지하면서 Standard 처리보다 최대 2.5배 빠르고 가격은 2배임
이전 버전과 호환되므로
priority태그가 붙은 기존 요청은 자동으로 Fast mode를 사용함
실제 운영 사례
Replit에서는 Luna의 가격과 성능이 예상보다 이른 신규 활용 사례를 열어줌
“GPT‑5.6 Luna는 지능의 비용을 사실상 측정하기 어려울 만큼 낮추는 데 가장 가까이 다가간 모델입니다. 이렇게 저렴하면서 강력한 모델은 처음이며, Replit에서 훨씬 나중에나 개발할 것으로 생각했던 활용 사례까지 가능하게 만들고 있습니다.”
Notion에서는 Terra가 지연 시간이 중요한 일상 업무에 적합했음
“GPT‑5.6 Terra는 워크스페이스 Q&A와 범위가 정해진 작업 등 Notion 개인 에이전트의 일상 업무에 잘 맞습니다. 평가 결과 GPT‑5.5와 비슷한 품질을 작업당 절반의 비용과 60% 짧은 시간으로 제공했습니다.”
Ramp의 내부 코딩 벤치마크에서는 Terra와 Luna가 비용 효율을 주도함
“모든 작업에서 비용 대비 결과를 극대화하는 데 집중하고 있으며, GPT‑5.6 시리즈는 이 점에서 크게 진전했습니다. Terra와 Luna는 내부 코딩 벤치마크 전반에서 비용 효율이 가장 높고, Luna는 이제 백그라운드 에이전트 자동화의 기본 모델입니다.”
Blitzy에서는 Luna를 도입해 단일 호출을 완전한 도구 호출 에이전트 루프로 확장함
“GPT‑5.6 Luna는 GPT‑4o mini를 프로덕션에 도입한 이후 확인한 에이전트 행동 중 가장 큰 도약입니다. 단일 구조화 출력 호출에서 완전한 도구 호출 에이전트 루프로 전환하면서 프롬프트 캐시 재사용률이 24%에서 90%로 높아졌습니다. 수천 건의 프로덕션 호출에서 GPT‑5.4 mini보다 2.2배 많은 컨텍스트를 처리하고 출력 토큰은 8.5배 적게 사용하며, 비용은 87% 낮습니다.”
Cognition에서는 Luna를 대형 모델과 함께 작동하는 페어 프로그래머로 활용함
“GPT‑5.6 Luna는 반복 업무 대부분을 처리하면서 비용과 지능의 균형을 맞춰 대형 모델과 함께 쓰기 좋은 페어 프로그래머입니다. Devin Fusion에 Luna를 통합해 품질 저하 없이 사용자 비용을 크게 절감했습니다.”
Dust에서는 동일한 에이전트 작업의 속도와 비용이 모두 개선됨
“GPT‑5.6 Luna를 도입한 뒤 운영 측면에서 의미 있는 개선을 확인했습니다. 동일한 에이전트 작업에서 이전 기본 모델보다 40% 빠르고 40% 저렴해 사용자 경험의 반응성이 높아졌으며, 품질·속도·효율의 균형도 뛰어납니다.”
결과에 맞춘 모델 선택
업무 단계마다 필요한 지능·속도·신뢰성·비용의 조합이 달라짐
결과의 중요도, 오류 비용, 긴급성, 처리 규모를 기준으로 적합한 모델을 선택하고, 평가를 통해 추가 지능이 결과를 실질적으로 개선하는 구간과 저렴하고 빠른 처리로 같은 품질을 낼 수 있는 구간을 구분할 수 있음
코딩 워크플로에서는 Sol로 불확실성을 해소하고 계획을 세운 뒤, Luna로 명확히 정의된 변경을 구현하고 테스트 작성·실행과 결과 평가를 처리하는 방식이 가능함
Luna는 1년 전 최첨단이었던 모델과 비슷한 성능을 작업당 약 6%의 비용과 거의 9배의 속도로 제공함
Agents' Last Exam으로 측정한 전문 업무에서는 Fable 5보다 높은 성능을 내면서 추정 작업당 비용은 거의 99% 낮음
GPT‑5.6 제품군을 활용하면 각 단계에서 유용한 만큼의 지능을 적용하고, 만들어 내는 가치에 맞춰 비용을 지불할 수 있음
효율 개선 방식
모델·추론 시스템·도구 및 컨텍스트를 연결하는 에이전트 실행 환경을 함께 개선함
GPT‑5.6은 작업을 더 직접적으로 처리하고, 향상된 라우팅은 하드웨어 활용도를 높이며, 최적화된 프로덕션 소프트웨어는 토큰을 더 효율적으로 생성함
컨텍스트 관리 개선으로 에이전트가 완료한 작업을 반복하지 않아 같은 컴퓨팅 자원으로 더 많은 유용한 일을 처리하고, 결과마다 필요한 시간·토큰·비용을 줄임
Sol도 사람 주도의 개발 과정에서 다음 효율 개선을 찾아 적용하고 있음
프로덕션 커널을 자율적으로 재작성·최적화하고, 토큰 생성을 개선하기 위한 수백 건의 실험을 설계·실행했으며, 학습을 감시하다 문제가 생기면 개입함
커널 작업으로 모델 제공의 전체 비용이 20% 줄어듦
실험을 통해 토큰 생성 효율이 15% 넘게 향상됨
모델의 성능과 자율성이 높아질수록 다음 효율 개선을 더 빠르게 찾아내는 피드백 순환이 강화됨
규모 확장을 위한 컴퓨팅 전략
더 많은 컴퓨팅 자원을 확보하는 동시에 각 자원의 생산성을 높임
복원력 있는 인프라 포트폴리오를 구축하고 각 워크로드를 가장 적합한 시스템에 배치해 가격 대비 성능 곡선의 양 끝을 지원함
저비용 영역에서는 Luna와 Terra의 새 가격으로 대량 작업을 훨씬 큰 규모까지 경제적으로 실행 가능
최첨단 영역에서는 응답 시간이 중요할 때 API 고객이 Fast mode로 Sol을 더 빠르게 이용할 수 있음
일상 업무에 AI를 넓게 적용하면서 중요한 작업의 속도도 유지 가능함
대규모 문서 분석, 고객 상호작용 분류, 반복적인 구현 작업은 광범위하게 운영할 수 있을 만큼 경제성이 높아짐
복잡한 Sol 워크로드는 추가 비용이 정당화될 때 더 빠르게 처리 가능
더 강력한 모델이 기술팀의 차세대 개선 작업을 지원하면서 성능 향상과 비용 절감까지 걸리는 시간이 단축되는 누적 효과가 생김
제공 범위와 가격
Terra와 Luna는 ChatGPT Work, Codex, OpenAI API에서 계속 제공됨
Free·Go 사용자는 Terra를 이용 가능
Plus·Pro·Business·Enterprise 사용자는 Terra와 Luna를 선택 가능
API의 새 가격은 7월 30일부터 적용됨
Terra는 입력 토큰 100만 개당 $2, 출력 토큰 100만 개당 $12임
Luna는 입력 토큰 100만 개당 $0.20, 출력 토큰 100만 개당 $1.20
Sol 가격은 바뀌지 않음
ChatGPT와 Codex의 구독 가격 및 할당량 예산은 그대로지만 Terra와 Luna가 소비하는 크레딧은 감소함
AWS에서는 이날 늦게부터 가격 변경이 순차 적용될 예정
Sol의 Fast mode는 API의 Priority Processing을 대체하고 Codex의
/fast와 대응함priority태그가 붙은 기존 API 요청도 계속 작동하며, 세부 금액은 전체 API 가격표에서 확인 가능
source https://openai.com/index/advancing-the-price-performance-frontier-with-gpt-5-6
