Claude Managed Agents Dreaming 완전 정리: 자가 개선 AI 에이전트의 구조와 활용법
Anthropic이 2025년 5월 6일 Managed Agents에 세 가지 새로운 기능을 추가했다. 이 글에서는 각 기능의 구조와 작동 방식을 단계별로 정리하고, 실제 활용 방법까지 설명한다.
목차
새로 추가된 기능 개요
Dreaming: 세션 간 자가 개선 메커니즘
Outcomes: 자동 출력 평가 시스템
멀티에이전트 오케스트레이션
Webhooks와 요금
전체 아키텍처: 자기 개선 루프
제한 사항과 주의점
빠른 참조 테이블
1. 새로 추가된 기능 개요
기능 | 상태 | 핵심 역할 |
|---|---|---|
Dreaming | 리서치 프리뷰 | 세션 간 패턴 추출 및 메모리 자동 업데이트 |
Outcomes | 퍼블릭 베타 | 개발자 정의 기준에 따른 자동 출력 평가 |
멀티에이전트 오케스트레이션 | 퍼블릭 베타 | 코디네이터 + 최대 20개 병렬 서브에이전트 |
Webhooks | 퍼블릭 베타 | 태스크 완료 시 푸시 알림 |
요금 | 제공 중 | $0.08/활성 세션 시간 + 표준 토큰 비용 |
2. Dreaming: 세션 간 자가 개선 메커니즘
기존 메모리와의 차이
기존 Claude 에이전트 메모리는 수동적이다. 개발자나 사용자가 명시적으로 "이걸 기억해"라고 지시할 때만 기록된다.
Dreaming은 다르다. 세션과 세션 사이에 스케줄된 백그라운드 프로세스로 실행된다.
작동 방식 단계별 설명
Step 1: 트랜스크립트 수집
에이전트가 완료한 과거 세션의 대화 트랜스크립트를 수집한다.
Step 2: 패턴 분석
다음 세 가지 유형의 패턴을 식별한다:
반복적으로 발생하는 실수
효과적이었던 접근 방식
놓쳤던 엣지 케이스
Step 3: 메모리 업데이트
추출한 패턴을 메모리 스토어에 기록한다. 원본 세션 데이터는 변경되지 않는다.
자율성 모드
Automatic 모드:
에이전트 판단 → 메모리 직접 기록
(사람 개입 없음)
Human Review 모드:
에이전트가 업데이트 제안 생성
→ 사람이 검토 및 승인
→ 승인 후 메모리에 반영
왜 중요한가
단일 세션은 크로스 세션 패턴을 볼 수 없다. 고객 지원 에이전트가 이번 달에 같은 분류 실수를 12번 했어도, 각 세션은 그것을 모른다. Dreaming은 바로 그 신호를 표면으로 끌어올린다.
3. Outcomes: 자동 출력 평가 시스템
구조
Outcomes는 두 가지 구성 요소로 이루어진다:
성공 루브릭: 개발자가 정의하는 "좋은 출력"의 기준
격리된 평가자: 에이전트의 추론 컨텍스트와 완전히 분리된 별도의 Claude 인스턴스
작동 흐름
에이전트가 출력 생성
↓
격리된 Claude 인스턴스가 루브릭에 따라 평가
↓
기준 충족? → 완료
기준 미충족? → 무엇을 바꿔야 하는지 식별 → 에이전트 재시도
성능 수치 (Anthropic 내부 테스트)
태스크 성공률: 표준 프롬프팅 대비 최대 10포인트 향상
.docx 구조화 파일 생성: +8.4%
.pptx 구조화 파일 생성: +10.1%
주관적 품질(편집 톤, 브랜드 일관성)에도 적용 가능
Dreaming과의 관계
Outcomes = 시험 (무엇이 실패인지 식별)
Dreaming = 오답 노트 (실패를 기억하고 다음에 활용)
이 둘이 결합되면 사람의 개입 없이 피드백 루프가 닫힌다.
4. 멀티에이전트 오케스트레이션
구조
코디네이터 에이전트
├── 서브에이전트 1 (독립 컨텍스트 윈도우)
├── 서브에이전트 2 (독립 컨텍스트 윈도우)
├── ...
└── 서브에이전트 N (최대 20개, 공통 파일시스템 공유)
주요 사양
Claude Console에서 전체 트레이스 가시화
코디네이터는 워크플로우 중간에 팔로업 메시지 전송 가능
서브에이전트는 교환 간 컨텍스트 유지
오케스트레이션 깊이: 1레벨 제한 (서브-서브에이전트 불가)
실제 도입 사례
기업 | 분야 | 결과 |
|---|---|---|
Harvey | 리걸 AI | 태스크 완료율 약 6배 향상 |
Wisedocs | 문서 검증 | 품질 유지하면서 리뷰 속도 50% 개선 |
Netflix | 빌드 분석 | 수백 개 빌드 로그 병렬 배치 분석 |
Spiral by Every | 콘텐츠 | Haiku 코디네이터 + Opus 라이팅 + Outcomes 그레이더 |
5. Webhooks와 요금
Webhooks
에이전트 태스크가 완료되면 시스템에 푸시 알림을 보낸다. 일부 에이전트 세션은 몇 시간씩 실행되기 때문에 폴링 대신 웹훅이 필수적이다.
요금 구조
기본: 표준 Claude API 토큰 요금
추가: $0.08/활성 세션 시간
아이들 시간: 무료
Dreaming, Outcomes, Webhooks: 별도 요금 없음
예시: 30분 태스크 = 토큰 비용 + $0.04 인프라 비용
6. 전체 아키텍처: 자기 개선 루프
세 기능이 결합되면 다음 루프가 완성된다:
태스크 분해 (오케스트레이션)
↓
실행
↓
출력 평가 (Outcomes)
↓
실패 패턴 기억 (Dreaming)
↓
다음 태스크에 적용
이것은 스테이트리스 툴에서 축적하는 시스템으로의 전환이다. 3개월 운영된 에이전트와 오늘 배포된 에이전트는, 같은 프롬프트를 가지고 있어도 이미 다른 시스템이다.
7. 제한 사항과 주의점
Claude 모델 전용
Managed Agents의 오케스트레이션, Dreaming, Outcomes 평가는 모두 Claude 모델에서만 동작한다. 비용 최적화나 특정 태스크 적합성을 위해 여러 모델을 사용하고 싶다면, 이 레이어는 별도로 해결해야 한다.
Dreaming은 아직 리서치 프리뷰
GA가 아니다. 프로덕션 환경 통합을 계획하고 있다면 상태 변화를 추적해야 한다.
자율적 메모리 업데이트의 리스크
Automatic 모드에서는 에이전트가 의도하지 않은 방향으로 "학습"할 가능성이 있다. Human Review 모드는 그 리스크에 대한 대응이다.
오케스트레이션 깊이 제한
서브-서브에이전트는 현재 불가능하다. 복잡한 계층적 태스크 분해가 필요한 유스케이스에서는 설계상 제약이 된다.
Sources:
Author: Jessie, EvoLink
멀티모델 구성으로 에이전트를 구축하고 있다면 EvoLink가 Claude, DeepSeek, GPT 등을 위한 통합 게이트웨이를 제공한다.
