3D 大型视觉语言模型的对抗鲁棒性研究
计算机视觉与模式识别
2026-01-13 v1
摘要
3D 视觉语言模型(VLMs),如 PointLLM 和 GPT4Point,已显示出在 3D 理解任务中强大的推理和泛化能力。然而,这些模型的对抗鲁棒性尚未得到广泛探讨。2D VLMs 的既有工作表明,视觉输入的集成显著增加了对抗攻击的脆弱性,使这些模型更容易被操纵以生成有毒或误导性输出。在本文中,我们调查了将 3D 视觉纳入是否会类似地损害 3D VLMs 的鲁棒性。为此,我们提出了对基于点的 3D VLMs 对抗鲁棒性的首个系统性研究。我们提出了两种互补的攻击策略:"视觉攻击",扰动由 3D 编码器和投影器产生的视觉标记特征,以评估视觉-语言对齐的鲁棒性;以及"描述攻击",直接操纵输出标记序列,以评估端到端系统的鲁棒性。每种攻击均包括无针对性和针对性变体,以衡量一般脆弱性和受控制操纵的易感性。我们的实验结果表明,在无针对性攻击下,3D VLMs 表现出显著的对抗脆弱性,而相较于其 2D 对手,在旨在强制生成特定有害输出的针对性攻击下,显示出更大的韧性。这些发现凸显了提高 3D VLMs 对抗鲁棒性的重要性,尤其是当它们被部署在安全关键应用中时。
引用
@article{arxiv.2601.06464,
title = {On the Adversarial Robustness of 3D Large Vision-Language Models},
author = {Chao Liu and Ngai-Man Cheung},
journal= {arXiv preprint arXiv:2601.06464},
year = {2026}
}
备注
Under Review