中文

解耦场景感知与自身状态:面向增强终端自动驾驶的多上下文融合方法

计算机视觉与模式识别 2025-11-19 v2

摘要

以规划为导向的自动驾驶模块化设计已显著推进了端到端系统的发展。然而,现有架构仍受限于对自身状态的过度依赖,导致泛化能力和鲁棒的场景理解受到制约。我们识别出根本原因在于,这些架构内置的设计,使得自身状态易于被用作捷径。具体而言,BEV 编码器中对自身状态的过早融合,使得来自该强先验的信息流主导了下游规划模块。为解决这一挑战,我们提出了基于多上下文融合策略的 AdaptiveAD 架构级解决方案。其核心是双分支结构,显式解耦场景感知与自身状态。一个分支基于多任务学习进行场景驱动推理,但故意不在 BEV 编码器中包含自身状态;另一个分支则仅基于规划任务进行自身驱动推理。随后,一个场景感知融合模块会自适应地整合两个分支的互补决策,以形成最终的规划轨迹。为确保解耦不损害多任务学习,我们引入了用于自身-BEV 交互的路径注意力机制,并添加两个针对性的辅助任务:BEV 单向蒸馏和自回归在线映射。大量评估在 nuScenes 数据集上表明,AdaptiveAD 实现了最先进的开放式规划性能。关键在于,它显著缓解了对自身状态的依赖,展现了在多样化场景中的强大泛化能力。

关键词

引用

@article{arxiv.2511.13079,
  title  = {Decoupling Scene Perception and Ego Status: A Multi-Context Fusion Approach for Enhanced Generalization in End-to-End Autonomous Driving},
  author = {Jiacheng Tang and Mingyue Feng and Jiachao Liu and Yaonong Wang and Jian Pu},
  journal= {arXiv preprint arXiv:2511.13079},
  year   = {2025}
}

备注

Accepted to AAAI 2026 (Oral)