中文

利用驾驶员视野进行多模态自车轨迹预测

计算机视觉与模式识别 2025-04-16 v2

摘要

理解驾驶员的决策对道路安全至关重要。尽管预测自车路径对驾驶员辅助系统很有价值,但现有方法主要关注其他车辆运动等外部因素,往往忽略了驾驶员的注意力和意图。为了弥补这一差距,我们通过整合驾驶员的注视点和周围场景来推断自车轨迹。我们引入了 RouteFormer,一种结合 GPS 数据、环境上下文和驾驶员视野(包括第一人称视频和注视点)的新型多模态自车轨迹预测网络。我们还提出了路径复杂性指数(Path Complexity Index, PCI),这是一种新的轨迹复杂性度量指标,能够对具有挑战性的场景进行更细致的评估。为了解决数据稀缺问题并增强多样性,我们引入了 GEM,一个包含同步驾驶员视野和注视点数据的丰富城市驾驶场景综合数据集。在 GEM 和 DR(eye)VE 上的广泛评估表明,RouteFormer 显著优于最先进的方法,在各种条件下预测精度均有显著提高。消融研究表明,纳入驾驶员视野数据可显著降低平均位移误差,特别是在 PCI 得分较高的具有挑战性的场景中,这凸显了建模驾驶员注意力的重要性。所有数据和代码可在 https://meakbiyik.github.io/routeformer 获取。

关键词

引用

@article{arxiv.2312.08558,
  title  = {Leveraging Driver Field-of-View for Multimodal Ego-Trajectory Prediction},
  author = {M. Eren Akbiyik and Nedko Savov and Danda Pani Paudel and Nikola Popovic and Christian Vater and Otmar Hilliges and Luc Van Gool and Xi Wang},
  journal= {arXiv preprint arXiv:2312.08558},
  year   = {2025}
}

备注

Accepted to 13th International Conference on Learning Representations (ICLR 2025), 29 pages