민감한 대화에서 ChatGPT의 맥락 인식을 개선하기
source https://openai.com/index/chatgpt-recognize-context-in-sensitive-conversations
사람들은 매일 ChatGPT를 찾아와, 일상적인 질문부터 더 개인적이거나 복잡한 대화까지 자신에게 중요한 일을 이야기함.
수억 건의 상호작용 중에는 힘든 시간을 보내거나 큰 고통을 겪는 사람들의 대화도 있음.
이런 순간에는 위기 대응 리소스를 안내하고, 필요하면 믿을 수 있는 사람과 연결하는 식으로 조심스럽게 응답하도록 시스템을 설계.
오늘 공개한 새 안전 업데이트로, 미묘하거나 점차 드러나는 단서를 포착해 시간이 지나며 위험이 생겨나는 상황을 ChatGPT가 더 잘 알아차리게 됨.
덕분에 매일 벌어지는 수억 건의 안전한 대화와, 추가 주의가 필요한 훨씬 드문 사례를 더 잘 구분 가능.
예: 긴장 완화, 유해한 세부정보 거절, 더 안전한 대안으로 유도.
이번 개선은 모델 훈련, 평가, 모니터링 시스템, 그리고 2년 넘게 이어진 정신건강·안전 전문가 협업 등 오랜 작업 위에 쌓인 결과.
민감한 대화에서 맥락이 중요한 이유
민감한 대화에서는 단일 메시지만큼이나 맥락도 중요함.
따로 보면 평범하거나 모호한 요청도, 앞서 나온 고통의 단서나 잠재적 유해 의도와 함께 보면 전혀 다른 의미가 될 수 있음.
그래서 주변 맥락에서 잠재적 유해 의도를 알아차려, 요청을 거절하고, 긴장을 낮추고, 지원 쪽으로 안내하도록 ChatGPT를 훈련함.
이런 사례는 흔치 않지만, 정확히 처리하는 일이 결정적으로 중요함.
목표는 평범한 대화에 과잉반응하지 않으면서, 필요할 때만 관련 단서를 연결하도록 만드는 것.
이번 작업은 자살, 자해, 타해 같은 급박한 시나리오에 초점을 맞춤.
정신건강 전문가와 함께 모델 정책과 훈련을 업데이트해, 대화가 이어지며 드러나는 경고 신호를 더 잘 인식하고 그 맥락을 더 신중한 응답에 반영하도록 개선.
이 드문 고위험 상황에서 ChatGPT는 무해한 요청과 더 높은 위해 위험을 시사하는 요청을 더 잘 구분함.
이는 safe completion approach를 확장한 개선.
사용자 요청의 안전하지 않은 부분은 거절하고, 안전하게 답할 수 있는 부분은 신중히 응답하도록 설계.
대화 안에서 위해 단서가 드러날수록 주의 수준을 높이되, 무해한 상황에서는 계속 도움이 되는 응답을 유지하는 것이 목표.
여러 대화에 걸친 안전성 개선
일부 안전 위험은 서로 다른 대화에 걸쳐 드러남.
한 대화에는 잠재적으로 해로운 의도의 미묘한 단서가 있고, 다른 대화에는 앞선 맥락과 합쳐졌을 때만 우려가 생기는 관련 요청이 들어올 수 있음.
이런 안전 관련 맥락이 없으면, 뒤의 대화와 중요한 경고 단서가 무해해 보일 수 있음.
이런 고통 신호를 더 잘 알아차리려 해온 기존 작업을 이어, 드문 고위험 상황에서 중요할 수 있는 앞선 안전 맥락을 짧고 사실 중심으로 적어 두는 safety summaries를 개발.
이 요약은 safety reasoning 작업용으로 훈련된 모델이 만들고, 범위를 좁게 유지하며, 제한된 기간만 보관하고, 심각한 안전 우려와 관련 있을 때만 사용함.
일반적인 개인화나 장기 기억이 아니라, 사실 기반의 안전 맥락만 담도록 설계.
ChatGPT가 이 맥락을 더 조심스럽게 쓰도록도 함께 훈련함.
추가 주의가 필요한 순간을 더 잘 알아차리고, 긴장을 완화하고, 세부정보 제공을 거절하고, 더 안전한 대안으로 유도 가능.
정신건강 전문가와의 협업
이 시스템은 Global Physicians Network 소속 정신건강 전문가들의 의견을 받아 개발.
법정심리, 자살 예방, 자해 분야 전문성을 가진 정신과 의사와 심리학자 포함.
이 전문가들은 safety summary를 언제 만들지, 얼마나 이전 맥락까지 의미가 있는지, 응답할 때 그 맥락을 얼마나 오래 반영할지 정하는 데 기여.
덕분에 이번 작업이 실제 현장 전문성에 더 단단히 닿았고, 민감한 상황에서 더 적절한 응답을 뒷받침하게 됨.
개선 측정
이번 업데이트로 ChatGPT는 대화 내부와 대화 사이에서 잠재적으로 해로운 의도의 패턴을 더 잘 인식함.
우려 단서가 서서히 드러날 때도, 그 패턴을 더 잘 식별하고 더 안전하게 응답함.
시간이 지나며 위험이 더 분명해지는 어려운 사례를 겨냥한 내부 평가에서, 안전한 응답 성능이 크게 개선.
이 테스트는 고위험 상황을 흉내 낸 대화에서, 모델이 의도한 안전 응답을 얼마나 자주 내놓는지 측정함.
하나의 긴 대화 시나리오에서는 자살·자해 사례의 안전 응답 성능이 50%, 타해 사례는 16% 개선.
앞부분 맥락이 뒤의 요청 의미를 어떻게 바꾸는지 더 잘 알아차리고, 그에 맞게 응답할 가능성이 크게 높아졌다는 뜻.
여러 대화와 여러 모델에 걸친 성능도 시험해, 모델이 진화해도 이런 개선이 유지되는지 확인.
현재 ChatGPT 기본 모델인 GPT‑5.5 Instant에서는 타해 사례 안전 응답 성능이 52%, 자살·자해 사례는 39% 개선.
safety summary 자체의 품질도 평가.
4,000건이 넘는 평가에서 안전 관련성 평균 점수 5점 만점에 4.93, 사실성 점수 5점 만점에 4.34 기록.
전반적으로 정확했고, 가장 중요한 안전 맥락에 집중했다는 의미.
이런 안전 맥락을 추가했을 때 평범한 대화 품질이 떨어지는지도 시험.
내부 테스트에서는 일상적인 채팅 응답 품질이 전반적으로 비슷했고, safety summary 유무에 따른 의미 있는 사용자 선호 차이도 없었음.
앞으로
시간이 지나야 분명해지는 위험을 AI 시스템이 알아차리게 만드는 일은 어렵고 장기적인 과제.
단서는 미묘할 수 있고, 여러 메시지에 흩어질 수 있고, 겉보기엔 평범한 대화 속에 묻힐 수도 있음.
이런 드물지만 중요한 순간을 더 잘 식별하고 적절히 응답하도록 ChatGPT를 계속 개선할 계획.
지금은 자해와 타해 시나리오에 집중.
앞으로는 신중한 안전장치를 전제로, biology나 cyber safety 같은 다른 고위험 영역에도 비슷한 방법을 적용할 수 있을지 살펴볼 수 있음.
이는 계속되는 우선순위이며, 모델과 이해가 발전하는 만큼 안전장치도 계속 강화할 예정.
안전 및 정신건강 관련 작업은 아래 글에서 더 볼 수 있음.
