改变的思考,改变的行动:探测 VLA 机器人操作中的链路思考漏洞
机器人学
2026-03-16 v1 人工智能
机器学习
摘要
最近的视觉语言-动作 (VLA) 模型越来越多地采用链路思考 (CoT) 推理,生成自然语言计划后再解码运动指令。这一推理模块与动作解码器之间的内部文本通道尚未接受对抗性审查。我们提出的问题是:该中间计划的哪些属性实际上被动作解码器依赖,以及仅以干扰推理痕迹(而不修改输入)是否会降低机器人的物理任务性能?我们设计了七类文本干扰,分为三个攻击者层级(盲噪声、机械语义和 LLM 自适应),并将其应用于跨 40 个 LIBERO 台面操作任务的前沿推理 VLA 模型。我们的结果揭示了一种显著的不对称性:替换推理痕迹中的物体名称会使整体成功率下降 8.3 个百分点——在目标条件任务中降幅达到 -19.3 个百分点,在单个任务中降幅达到 -45 个百分点——而句子重排序、空间方向反转、标记噪声,甚至是由 70B 参数 LLM 精心制作的合理但错误计划几乎没有影响(在 ±4 个百分点范围内)。这种不对称性表明,动作解码器依赖实体引用的完整性,而非推理质量或序列结构。值得注意的是,尽管保持合理性的高级 LLM 攻击者未能超越简单的机械物体名称替换,但这恰恰因为保持合理性意味着保留了解码器所需的实体 grounding 结构。使用非推理 VLA 进行跨架构控制,确认该漏洞仅存在于具有推理增强功能的模型中,而指令级别的攻击会同时影响两个架构——这表明内部推理痕迹是一个独立且隐蔽的威胁向量,无法被输入验证防御机制发现。
引用
@article{arxiv.2603.12717,
title = {Altered Thoughts, Altered Actions: Probing Chain-of-Thought Vulnerabilities in VLA Robotic Manipulation},
author = {Tuan Duong Trinh and Naveed Akhtar and Basim Azam},
journal= {arXiv preprint arXiv:2603.12717},
year = {2026}
}