中文

面临威胁的操控:评估端到端视觉-语言-动作模型的物理脆弱性

计算机视觉与模式识别 2025-11-06 v4

摘要

最近,在多模态大语言模型的进步推动下,视觉-语言-动作模型被提出,旨在为机器人操控任务在开放词汇场景中实现更好的性能。由于操控任务涉及与物理世界的直接交互,确保该任务执行过程中的鲁棒性与安全性始终是一个非常关键的问题。在本文中,通过综合当前关于 MLLMs 的安全性研究以及操控任务在物理世界中的具体应用场景,我们全面评估了 VLAMs 面临潜在物理威胁时的表现。具体而言,我们提出了物理脆弱性评估流水线,该流水线能够尽可能多地纳入视觉模态的物理威胁,用于评估 VLAMs 的物理鲁棒性。PVEP 中的物理威胁具体包括分布外、基于排版的视觉提示和对抗补丁攻击。通过比较 VLAMs 在受攻击前后的性能波动,我们提供了关于 VLAMs 如何响应不同物理威胁的具有泛化能力的分析。

关键词

引用

@article{arxiv.2409.13174,
  title  = {Manipulation Facing Threats: Evaluating Physical Vulnerabilities in End-to-End Vision Language Action Models},
  author = {Hao Cheng and Erjia Xiao and Yichi Wang and Chengyuan Yu and Mengshu Sun and Qiang Zhang and Jiahang Cao and Yijie Guo and Ning Liu and Kaidi Xu and Jize Zhang and Chao Shen and Philip Torr and Jindong Gu and Renjing Xu},
  journal= {arXiv preprint arXiv:2409.13174},
  year   = {2025}
}