中文

ORION:基于视觉语言指令动作生成的整体端到端自动驾驶框架

计算机视觉与模式识别 2025-03-26 v1

摘要

由于因果推理能力有限,端到端 (E2E) 自动驾驶方法在交互式闭环评估中仍难以做出正确决策。当前方法试图利用视觉语言模型 (VLM) 强大的理解与推理能力来解决这一困境。然而,由于语义推理空间与动作空间中纯数值轨迹输出之间存在差距,适用于 E2E 方法的 VLM 在闭环评估中表现良好的问题仍未解决。为解决此问题,我们提出了 ORION,一个通过视觉语言指令动作生成实现的整体 E2E 自动驾驶框架。ORION 独特地结合了用于聚合长期历史上下文的 QT-Former、用于驾驶场景推理的大语言模型 (LLM) 以及用于精确轨迹预测的生成式规划器。ORION 进一步对齐了推理空间与动作空间,以实现对视觉问答 (VQA) 和规划任务的统一 E2E 优化。我们的方法在挑战性 Bench2Drive 数据集上取得了 77.74 驾驶分数 (DS) 和 54.62% 成功率 (SR) 的出色闭环性能,以 14.28 DS 和 19.61% SR 的巨大优势超越了现有最先进 (SOTA) 方法。

关键词

引用

@article{arxiv.2503.19755,
  title  = {ORION: A Holistic End-to-End Autonomous Driving Framework by Vision-Language Instructed Action Generation},
  author = {Haoyu Fu and Diankun Zhang and Zongchuang Zhao and Jianfeng Cui and Dingkang Liang and Chong Zhang and Dingyuan Zhang and Hongwei Xie and Bing Wang and Xiang Bai},
  journal= {arXiv preprint arXiv:2503.19755},
  year   = {2025}
}