AI 챗봇을 위한 위험한 새로운 탈옥이 방금 발견되었습니다

마이크로소프트 건물 옆면
위키미디어 공용

Microsoft는 "Skeleton Key"라고 불리는 문제가 있는 새로운 생성 AI 탈옥 기술에 대한 자세한 내용을 공개했습니다 . 이 신속한 주입 방법을 사용하여 악의적인 사용자는 ChatGPT가 Taye의 전체 성능을 발휘하지 못하게 하는 보안 기능인 챗봇의 안전 가드레일을 효과적으로 우회할 수 있습니다.

스켈레톤 키(Skeleton Key)는 신속한 주입이나 신속한 엔지니어링 공격의 예입니다. 이는 AI 모델이 뿌리 깊은 안전 가드레일을 무시하도록 본질적으로 설득하기 위해 고안된 다중 회전 전략으로, "시스템이 운영자의 정책을 위반하거나 사용자의 영향을 과도하게 영향을 받는 결정을 내리거나 악의적인 지침을 실행하도록 합니다."라고 Mark Russinovich는 말합니다. Microsoft Azure의 CTO가 발표문에 썼습니다.

또한 즉석에서 못 폭탄을 만드는 방법이나 시체를 분해하는 가장 효율적인 방법 등 해롭거나 위험한 정보를 공개하도록 속일 수도 있습니다.

스켈레톤 키 공격의 예
마이크로소프트

공격은 먼저 모델에 가드레일을 완전히 변경하는 대신 강화하도록 요청하고, 금지된 요청에 대해 완전히 거부하는 대신 경고를 발행하는 방식으로 작동합니다. 탈옥이 성공적으로 수락되면 시스템은 가드레일 업데이트를 승인하고 사용자의 지시에 따라 주제에 관계없이 요청된 콘텐츠를 생성합니다. 연구팀은 폭발물, 생물무기, 정치, 인종차별, 마약, 자해, 노골적인 성행위, 폭력 등 다양한 주제에 걸쳐 이 공격을 성공적으로 테스트했습니다.

악의적인 행위자는 시스템이 나쁜 말을 하게 만들 수 있지만, Russinovich는 공격자가 이 기술을 사용하여 실제로 달성할 수 있는 액세스 유형에는 한계가 있음을 재빠르게 지적했습니다. “모든 탈옥과 마찬가지로, 그 영향은 모델이 수행할 수 있는 작업(사용자 자격 증명 등을 고려하여)과 모델이 하려는 작업 사이의 격차를 줄이는 것으로 이해될 수 있습니다.”라고 그는 설명했습니다. “이것은 모델 자체에 대한 공격이므로 다른 사용자의 데이터에 대한 접근을 허용하거나 시스템을 제어하거나 데이터를 유출하는 등 AI 시스템에 다른 위험을 전가하지 않습니다.”

연구의 일환으로 Microsoft 연구원들은 Meta의 Llama3-70b-instruct , Google의 Gemini Pro , OpenAI의 GPT-3.5 Turbo 및 GPT-4, Mistral Large, Anthropic의 Claude 3 Opus를 포함한 다양한 주요 AI 모델에서 Skeleton Key 기술을 테스트했습니다. 그리고 코히어 커맨더 R 플러스. 연구팀은 이미 해당 개발자들에게 취약점을 공개했으며 Copilot을 포함한 Azure 관리 AI 모델에서 이 탈옥을 감지하고 차단하기 위해 Prompt Shields를 구현했습니다.


게시됨

카테고리

작성자

태그: