Phantom Menace:探索 VLA 模型对物理传感器攻击的鲁棒性
机器人学
2025-12-22 v2 人工智能
摘要
视觉-语言-动作(VLA)模型通过集成多种感知模态(如由摄像头处理的视觉信号和由麦克风捕获的听觉信号)的端到端感知到动作管道,彻底革新了机器人系统。这种多模态集成使 VLA 模型能够使用多样化的传感器数据流解释复杂的真实世界环境。鉴于 VLA 系统高度依赖感知输入,VLA 模型针对物理世界传感器攻击的安全性仍严重未被探索。为填补这一空白,我们提出首个针对 VLA 的物理传感器攻击的系统性研究,量化攻击影响并调查防御措施。我们引入一种新的“Real-Sim-Real”框架,自动模拟基于物理的传感器攻击向量,包括面向摄像头的六种攻击和面向麦克风的两种攻击,并在真实机器人系统上进行验证。通过在各种 VLA 架构和任务下进行大规模评估,并在不同攻击参数下进行测试,我们展示了显著的脆弱性,揭示了暴露关键依赖性的模式,这些模式揭示了任务类型和模型设计之间的关键关系。我们进一步开发了基于对抗训练的防御方法,以增强 VLA 对由传感器攻击引起的外分布物理扰动的鲁棒性,同时保持模型性能。我们的发现暴露了迫在眉下的需求,即需要标准化的鲁棒性基准和缓解策略,以保障在安全关键环境中 VLA 部署的可靠性。
引用
@article{arxiv.2511.10008,
title = {Phantom Menace: Exploring and Enhancing the Robustness of VLA Models Against Physical Sensor Attacks},
author = {Xuancun Lu and Jiaxiang Chen and Shilin Xiao and Zizhi Jin and Zhangrui Chen and Hanwen Yu and Bohan Qian and Ruochen Zhou and Xiaoyu Ji and Wenyuan Xu},
journal= {arXiv preprint arXiv:2511.10008},
year = {2025}
}
备注
Accepted by AAAI 2026 main track