BadVLA:通过目标解耦优化对视觉-语言-动作模型实施后门攻击
密码学与安全
2025-05-23 v1 人工智能
摘要
视觉-语言-动作(VLA)模型通过直接从多模态输入进行端到端决策,推动了机器人控制的发展。然而,其紧耦合架构暴露了新的安全漏洞。与传统的对抗性扰动不同,后门攻击代表了一种更隐蔽、更持久且具有实际意义的威胁——尤其是在新兴的训练即服务范式下——但在 VLA 模型的背景下,这类攻击在很大程度上仍未得到探索。为填补这一空白,我们提出了 BadVLA,一种基于目标解耦优化的后门攻击方法,首次揭示了 VLA 模型的后门漏洞。具体来说,它包含一个两阶段过程:(1)显式特征空间分离,将触发器表示与良性输入隔离开来;(2)条件控制偏差,仅在存在触发器时激活,同时保持干净任务的性能。在多个 VLA 基准上的实证结果表明,BadVLA 始终能实现接近 100% 的攻击成功率,同时对干净任务准确性的影响极小。进一步的分析证实了其对常见输入扰动、任务迁移和模型微调的鲁棒性,突显了当前 VLA 部署中的关键安全漏洞。我们的工作首次对 VLA 模型中的后门漏洞进行了系统性研究,强调了安全可信的具身模型设计实践的迫切需求。我们已在 https://badvla-project.github.io/ 发布了项目页面。
引用
@article{arxiv.2505.16640,
title = {BadVLA: Towards Backdoor Attacks on Vision-Language-Action Models via Objective-Decoupled Optimization},
author = {Xueyang Zhou and Guiyao Tie and Guowen Zhang and Hechang Wang and Pan Zhou and Lichao Sun},
journal= {arXiv preprint arXiv:2505.16640},
year = {2025}
}
备注
19 pages, 12 figures, 6 tables