中文

面向LLM-based机器人的可执行政策劫持攻击:POEX

机器人学 2025-08-12 v3 人工智能 计算机与社会

摘要

将LLM集成到机器人中已见证显着增长,LLM可以将指令转换为可执行的机器人政策。然而,LLM对劫持攻击的内在脆弱性带来了从数字域到物理世界的关键安全风险。受LLM攻击的机器人可能执行有害政策并造成物理伤害。本文调查了LLM-based机器人实施劫持攻击的可行性和理由,并回答了三个研究问题:(1)现有的LLM劫持攻击如何适用于LLM-based机器人?(2)如果它们不直接适用,会出现什么独特挑战?(3)如何防御此类劫持攻击?为此,我们首先构建一个以"人-对象-环境"机器人风险导向的Harmful-RLbench,然后对LLM-based机器人系统进行测量研究。我们的发现表明,传统的LLM劫持攻击在机器人场景下不可直接应用,我们识别了两个独特挑战:确定政策可执行优化方向和准确评估机器人劫持政策。为更全面的安全分析,我们引入POEX(POlicy EXecutable)劫持,一个红队框架,可诱导有害且可执行的政策劫持LLM-based机器人。POEX集成了隐藏层梯度优化以保证劫持成功和政策执行,以及多智能体评估器以准确评估政策的可执行性。在真实机器人系统和仿真环境中的实验表明,POEX的有效性,突显了关键安全漏洞及其跨LLM的可迁移性。最后,我们提出基于提示词和基于模型的防御措施来缓解攻击。我们的发现强调,为确保LLM-based机器人在关键应用中安全部署迫在眉睫,需要安全措施。

关键词

引用

@article{arxiv.2412.16633,
  title  = {POEX: Towards Policy Executable Jailbreak Attacks Against the LLM-based Robots},
  author = {Xuancun Lu and Zhengxian Huang and Xinfeng Li and Chi Zhang and Xiaoyu ji and Wenyuan Xu},
  journal= {arXiv preprint arXiv:2412.16633},
  year   = {2025}
}

备注

Homepage: https://poex-jailbreak.github.io/