中文

ICR-Drive:面向端到端语言驱动自主驾驶的指令反事实鲁棒性

计算与语言 2026-05-28 v1 计算机视觉与模式识别

摘要

近期在视觉语言动作(VLA)模型方面的进展使语言条件化驾驶代理能够在闭环仿真环境中执行自然语言导航指令,但标准评估大多假设指令精确且结构良好。在实际部署中,指令的表述和具体性会有所变化,可能遗漏关键限定词,甚至包含误导性、权威导向的文本,导致对指令层面鲁棒性的测量不足。我们提出ICR-Drive,一个用于端到端语言条件化自主驾驶中指令反事实鲁棒性的诊断框架。ICR-Drive生成控制化的指令变体,涵盖四种扰动类型:改写(Paraphrase)、歧义(Ambiguity)、噪声(Noise)以及误导(Misleading),其中误导变体与导航目标冲突,试图覆盖意图。我们在匹配的仿真器配置和随机种子下重放相同的CARLA路线,以隔离因指令语言引起的性能变化。通过标准CARLA Leaderboard指标以及相对于基线指令的各家族性能下降来量化鲁棒性。实验在LMDrive和BEVDriver上表明,微小的指令变更可能导致显著的性能下降并引发不同的失败模式,揭示了在安全关键驾驶场景中部署具身基础模型存在的可靠性差距。

关键词

引用

@article{arxiv.2604.05378,
  title  = {ICR-Drive: Instruction Counterfactual Robustness for End-to-End Language-Driven Autonomous Driving},
  author = {Kaiser Hamid and Can Cui and Nade Liang},
  journal= {arXiv preprint arXiv:2604.05378},
  year   = {2026}
}