通过对抗性物体融合破坏视觉-语言模型驱动的导航服务
密码学与安全
2025-05-30 v1 人工智能
计算机视觉与模式识别
摘要
我们提出了对抗性物体融合(Adversarial Object Fusion, AdvOF),这是一种新颖的攻击框架,通过生成对抗性 3D 物体,在面向服务的环境中针对视觉与语言导航(VLN)智能体进行攻击。虽然大语言模型(LLMs)和视觉语言模型(VLMs)等基础模型通过提升感知和决策能力增强了面向服务的导航系统,但它们的集成在关键任务服务流程中引入了漏洞。现有的对抗性攻击未能解决服务计算环境中的问题,而在该环境中可靠性和服务质量(QoS)至关重要。我们利用 AdvOF 来研究和探索对抗性环境对基于 VLM 的 VLN 智能体感知模块的影响。具体而言,AdvOF 首先在 2D 和 3D 空间中精确聚合并对齐目标物体位置,定义并渲染对抗性物体。然后,我们在物理属性和 VLM 感知之间,通过对抗性物体与目标物体之间的正则化,协同优化对抗性物体。通过为不同视图分配重要性权重,优化过程通过局部更新和调整的迭代融合,实现稳定且多视图的处理。我们广泛的评估表明,AdvOF 可以在对抗性条件下有效降低智能体性能,同时对正常导航任务保持最小干扰。这项工作推进了对 VLM 驱动导航系统中服务安全的理解,为物理世界部署中鲁棒的服务组合提供了计算基础。
引用
@article{arxiv.2505.23266,
title = {Disrupting Vision-Language Model-Driven Navigation Services via Adversarial Object Fusion},
author = {Chunlong Xie and Jialing He and Shangwei Guo and Jiacheng Wang and Shudong Zhang and Tianwei Zhang and Tao Xiang},
journal= {arXiv preprint arXiv:2505.23266},
year = {2025}
}
备注
Under review