中文

一次注入,后生存:面向 Vision-Language-Action 模型的后门攻击持久化研究

机器人学 2026-02-03 v1

摘要

Vision-Language-Action (VLA) 模型正在成为现代具身人工智能系统的基础模型。通过整合视觉感知、语言理解和动作规划,它们能够在多样化环境中实现通用任务执行。尽管如此,VLA 模型的安全性仍未得到充分探讨——尤其是在后门攻击的背景下,这类攻击在物理世界部署中构成现实威胁。虽然近期方法试图注入后门到 VLA 模型中,但这些后门在下游适应期间容易被擦除,因为使用干净数据进行的用户侧微调会显著改变模型参数,使其在实际应用中难以实用。为解决这些挑战,我们提出了 INFUSE (INjection into Fine-tUne-inSensitive modulEs),即首个面向 VLA 基础模型的后门攻击框架,其有效性即使在任意用户微调后仍然保持。INFUSE 通过分析多样化微调场景下的参数敏感性,以识别保持基本不变的模块——即微调不敏感模块。随后将后门注入这些稳定模块,同时冻结其余部分,以确保恶意行为在大量用户微调后仍能持续存活。跨多个 VLA 架构的全面实验表明,INFUSE 的有效性显著优于 BadVLA。在仿真环境下,INFUSE 保持了 91.0% 的平均攻击成功率,在真实机器人任务上为 79.8%,而 BadVLA 分别为 38.8% 和 36.6%,同时保持干净任务性能与标准模型相当。这些结果揭示了一个关键威胁:在分发前植入的后门能够通过微调在部署时持续存活并保持有效性。

关键词

引用

@article{arxiv.2602.00500,
  title  = {Inject Once Survive Later: Backdooring Vision-Language-Action Models to Persist Through Downstream Fine-tuning},
  author = {Jianyi Zhou and Yujie Wei and Ruichen Zhen and Bo Zhao and Xiaobo Xia and Rui Shao and Xiu Su and Shuo Yang},
  journal= {arXiv preprint arXiv:2602.00500},
  year   = {2026}
}