面向视觉-语言-动作模型的模型无关性对抗攻击与防御
计算机视觉与模式识别
2025-10-16 v1 机器学习
摘要
视觉-语言-动作 (VLA) 模型在机器人学习中取得了革命性进展,使机器人能够从自然语言指令中执行复杂的物理机器人任务。尽管如此,这些模型的对抗鲁棒性仍未得到充分探索。本文提出了针对 VLA 模型的对抗性补丁攻击及相应防御策略。首先,本文引入嵌入扰动补丁攻击 (EDPA),这是一种无模型依赖的对抗攻击,可直接生成可放置于摄像头视野内的补丁。与先前方法相比,EDPA 可无需了解模型架构或受控机器人机械臂即可适用于不同 VLA 模型。EDPA 通过 (i) 扰乱视觉与文本潜表示之间的语义对齐,以及 (ii) 最大化对抗性输入与对应干净视觉输入之间潜表示的差异来构建这些补丁。通过优化这些目标,EDPA 会扭曲 VLA 对视觉信息的解释,导致模型反复生成错误的动作,最终导致无法完成给定的机器人任务。为对抗该攻击,本文提出了一种针对视觉编码器的对抗微调方案,即该编码器被优化以产生干净和受对抗性扰动视觉输入相似的潜表示。广泛的评估表明,EDPA 在广被认可的 LIBERO 机器人仿真基准上显著增加了 cutting-edge VLA 模型的任务失败率,而我们提出的防御有效地缓解了这种性能下降。代码可通过主页 https://edpa-attack.github.io/ 获取。
引用
@article{arxiv.2510.13237,
title = {Model-agnostic Adversarial Attack and Defense for Vision-Language-Action Models},
author = {Haochuan Xu and Yun Sing Koh and Shuhuai Huang and Zirun Zhou and Di Wang and Jun Sakuma and Jingfeng Zhang},
journal= {arXiv preprint arXiv:2510.13237},
year = {2025}
}