InsightDrive:面向端到端自动驾驶的洞察性场景表示
计算机视觉与模式识别
2025-12-02 v2
摘要
传统的端到端自动驾驶方法通常依赖显式的全局场景表示,这些表示一般由 3D 目标检测、在线地图构建和运动预测组成。相比之下,人类驾驶员会有选择地关注与任务相关的区域,并对更广泛的交通上下文进行隐式推理。受此观察启发,我们提出了一种轻量级的端到端自动驾驶框架 InsightDrive。与直接嵌入大型语言模型(LLM)的方法不同,InsightDrive 引入了一种 Insight 场景表示,联合建模以注意力为中心的显式场景表示和以推理为中心的隐式场景表示,从而使场景理解更贴近人类用于轨迹规划的认知模式。为此,我们采用思维链(CoT)指令来建模人类驾驶认知,并设计了一个任务级的混合专家适配器,以可忽略的参数代价将这一知识注入自动驾驶模型。我们进一步将规划器条件化于显式和隐式场景表示,并采用基于扩散的生成式策略,从而产生鲁棒的轨迹预测和决策。整体框架建立了一个知识蒸馏流水线,将人类驾驶知识转移给 LLM,随后再转移至车载模型。在 nuScenes 和 Navsim 基准上的大量实验表明,InsightDrive 相较于传统场景表示方法取得了显著提升。
引用
@article{arxiv.2503.13047,
title = {InsightDrive: Insight Scene Representation for End-to-End Autonomous Driving},
author = {Ruiqi Song and Xianda Guo and Yanlun Peng and Qinggong Wei and Hangbin Wu and Long Chen},
journal= {arXiv preprint arXiv:2503.13047},
year = {2025}
}