中文

sudo rm -rf agentic_security

计算与语言 2025-06-10 v3 人工智能 密码学与安全

摘要

大型语言模型(LLM)日益被部署为计算机使用代理,能够在真实桌面或网页环境中自主执行任务。尽管这一演变大大扩展了人类的实际应用场景,但也带来了严重的安全风险。我们提出了 SUDO(Screen-based Universal Detox2Tox Offense),一种新型攻击框架,系统性地绕过商业计算机使用代理(如 Claude for Computer Use)中训练的拒绝安全措施。核心机制 Detox2Tox 将最初被拒绝的有害请求转化为看似无害的请求,通过 detoxification,从而获取来自高级视觉语言模型(VLM)的详细指令,然后在执行前通过 toxification 重新引入恶意内容。与传统越狱不同,SUDO 利用内置的拒绝反馈迭代细化其攻击,使其对强大的策略过滤器更加有效。在覆盖 50 个真实世界任务和多个最先进 VLM 的广泛测试中,SUDO 的攻击成功率为 24.41%(无细化),通过迭代细化后可达到 41.33%(针对 Claude for Computer Use)。通过揭示这些漏洞并展示其在真实计算环境中被轻易利用的便捷性,本文凸显了对健壮、情境感知安全措施的紧迫需求。WARNING:本文包含有害或冒犯的模型输出

关键词

引用

@article{arxiv.2503.20279,
  title  = {sudo rm -rf agentic_security},
  author = {Sejin Lee and Jian Kim and Haon Park and Ashkan Yousefpour and Sangyoon Yu and Min Song},
  journal= {arXiv preprint arXiv:2503.20279},
  year   = {2025}
}

备注

Accepted ACL 2025 Industry track