中文

Lost in Fog: 传感器扰动暴露驾驶视觉语言动作(VLA)的推理脆弱性

机器人学 2026-05-21 v1 人工智能

摘要

可解释的自动驾驶规划器不仅需要生成解释,还需要这些解释在现实世界传感器降级时保持可靠。本文我们针对视觉语言动作(VLA)在自动驾驶中的鲁棒性进行受控扰动研究,在八种传感器扰动(四种强度的高斯噪声、两种极端照明和两种雾浓度)下评估 Alpamayo R1(10B 参数)的 1,996 个场景(约 18,000 次推理试验)。我们发现,推理一致性是轨迹可靠性的高保真指示器:当链式因果(Chain-of-Causation, CoC)解释在扰动后发生变化时,轨迹偏离会增加 5.3×5.3{\times}(21.8m vs 4.1m),且在所有攻击类型下相关系数为 r=0.99r=0.99,按样本相关系数为 rpb=0.53r_{pb}=0.53(Cohen's d=1.12d=1.12)。受控消除实验提供证据表明,启用 CoC 生成与在匹配的推理设置下提高轨迹准确性有关(平均提升 11.8%;p<0.0001p < 0.0001)。在测试的噪声范围内(σ{10,30,50,70}\sigma \in \{10, 30, 50, 70\}),退化约为线性(R2=0.957R^2=0.957),而标准的输入预处理防御仅提供有限的缓解。总体而言,这些结果确立了 CoC 一致性作为规划安全的量化代理,并激励基于推理的运行时监控,以实现更安全的 VLA 部署。

关键词

引用

@article{arxiv.2605.21446,
  title  = {Lost in Fog: Sensor Perturbations Expose Reasoning Fragility in Driving VLAs},
  author = {Abhinaw Priyadershi and Jelena Frtunikj},
  journal= {arXiv preprint arXiv:2605.21446},
  year   = {2026}
}