中文

BadNAVer:探索面向视觉语言导航的越狱攻击

机器人学 2025-05-20 v1

摘要

多模态大语言模型(MLLM)近期因其在视觉语言导航(VLN)任务中的泛化与推理能力而受到关注,推动了由MLLM驱动的导航器兴起。然而,MLLM易受越狱攻击的威胁,这类攻击通过精心构造的提示绕过安全机制,触发不必要的输出。在具身化场景中,这类漏洞风险更大:与纯文本模型仅生成有害内容不同,具身化代理可能将恶意指令解释为可执行命令,潜在导致实际危害。本文提出首个针对MLLM驱动导航器的系统化越狱攻击范式。我们构建三层次的攻击框架,并在四类意图类别中构造恶意查询,拼接标准导航指令。在Matterport3D模拟器中,我们评估了由五种MLLM驱动的导航代理的攻击效果,报告平均攻击成功率超过90%。为测试现实可行性,我们在物理机器人上复制了该攻击。结果表明,即便是经过精心设计的提示,也能在MLLM中诱导有害行为和意图,风险远超有害输出,可能导致实际身体伤害。

关键词

引用

@article{arxiv.2505.12443,
  title  = {BadNAVer: Exploring Jailbreak Attacks On Vision-and-Language Navigation},
  author = {Wenqi Lyu and Zerui Li and Yanyuan Qiao and Qi Wu},
  journal= {arXiv preprint arXiv:2505.12443},
  year   = {2025}
}

备注

8 pages, 4 figures