Tex3D:通过对抗性 3D 纹理将对象作为攻击面用于视觉-语言-动作模型
计算机视觉与模式识别
2026-04-03 v1 人工智能
摘要
视觉-语言-动作(VLA)模型在机器人操控中展现出强大的性能,但其对可实现对抗攻击的鲁棒性仍未得到充分探讨。现有研究通过语言扰动和 2D 视觉攻击揭示了漏洞,但这些攻击面要么不够贴近实际部署,要么在物理真实性上受限。相比之下,adversarial 3D 纹理更具物理可实现性和破坏性,因为它们自然地附着在被操纵的对象上,且更易于在物理环境中部署。将对抗性 3D 纹理引入 VLA 系统仍非易事。核心难点在于,标准 3D 模拟器无法为从 VLA 目标函数回传到对象外观提供可微分的优化路径,从而难以以 end-to-end 方式进行优化。为此,我们引入了 Foreground-Background Decoupling(FBD),通过 dual-renderer alignment 实现纹理的可微分优化,同时保留原始模拟环境。为进一步确保攻击在物理世界中跨越长时序和多样化视角仍有效,我们提出了 Trajectory-Aware Adversarial Optimization(TAAO),优先关注行为关键帧,并通过基于顶点的参数化方式稳定优化。基于上述设计,我们构建了 Tex3D,即第一个在 VLA 模拟环境中实现 3D 对抗纹理 end-to-end 优化的框架。仿真和真实机器人实验表明,Tex3D 在多种操控任务中显著降低 VLA 性能,任务失败率可达最高的 96.7%。我们的实证结果揭示了 VLA 系统对基于物理的 3D 对抗攻击的关键漏洞,并凸显了面向鲁棒训练的必要性。
引用
@article{arxiv.2604.01618,
title = {Tex3D: Objects as Attack Surfaces via Adversarial 3D Textures for Vision-Language-Action Models},
author = {Jiawei Chen and Simin Huang and Jiawei Du and Shuaihang Chen and Yu Tian and Mingjie Wei and Chao Yu and Zhaoxia Yin},
journal= {arXiv preprint arXiv:2604.01618},
year = {2026}
}