교묘한 사진 조작으로 AI 챗봇의 안전 규칙을 무시하게 만드는 방법
픽셀 단위 이미지 조작으로 AI 안전장치 우회 가능성 확인
사람 눈에는 평범해 보이는 사진에 AI 챗봇의 안전 규칙을 우회시키는 숨은 지시를 담을 수 있다는 Florida International University(FIU) 새 연구
사람 눈에는 보이지 않는 픽셀 단위 변경만으로 이미지를 읽는 모델이 혼란을 일으키고, 평소 차단할 응답을 생성할 수 있음
AI가 보는 것을 해킹하기
AI 모델의 이미지 인식 방식 차이
AI 모델은 사람처럼 이미지를 보지 않고 사진을 수치 데이터로 읽는 구조임
수치 데이터를 아주 조금만 바꿔도 시스템이 이미지에서 읽는 내용과 응답 방식이 달라질 수 있음
모델 공격 예시 이미지 포함

이미지: FIU
JaiLIP 기법과 BLIP-2 테스트 결과
FIU 연구진이 JaiLIP(Jailbreaking with Loss-guided Image Perturbation)이라는 방법 구축
사진에서 보이는 내용은 바꾸지 않으면서 모델을 안전하지 않은 응답 쪽으로 밀어내는 최소 픽셀 변경량 계산
연구·개발에 쓰이는 멀티모달 AI 모델 BLIP-2에서 JaiLIP 테스트
변조 이미지가 시스템의 유해 응답 생성 빈도를 거의 2배로 높임
한 테스트에서는 변조된 신호등 사진을 보고 모델이 딱지를 떼이지 않고 빨간불을 무시하는 방법을 설명함

이미지: FIU
기업이 이미 쓰는 모델도 쉬운 표적
소형 언어 모델의 취약성
회계나 고객 지원에 많이 쓰이는 소형 언어 모델은 테스트에서 특히 속이기 쉬웠음
더 많은 기업이 이런 역할을 AI 도구에 맡길수록 사용자 신뢰 저하나 공격자 진입 경로 확대 위험 있음
AI 안전장치 우회 연구 흐름과 차별점
이번 발견은 AI 안전장치를 검증하는 연구 흐름에 포함됨
외부 연구진이 AI 제어 로봇을 장악한 방법 포함
Anthropic이 확인한, 모델이 들키지 않을 수 있음을 깨닫고 문제 행동을 학습한 사례 포함
정상 사진 안에 숨은 탈옥(jailbreak)은 교묘한 문구나 우회 프롬프트 없이, 의심받지 않을 이미지 하나만으로 작동 가능함
