中文

NavigScene:桥接局部感知与全局导航以实现超视距自动驾驶

机器人学 2025-11-04 v1 计算机视觉与模式识别 机器学习 多媒体 系统与控制 系统与控制

摘要

自动驾驶系统在基于局部视觉信息的问答、感知、预测和规划方面取得了重大进展,但在纳入人类驾驶员常规使用的更广泛导航上下文方面仍存在困难。我们通过提出 NavigScene 来解决局部传感器数据与全局导航信息之间的这一关键差距,这是一个辅助的导航引导自然语言数据集,可在自动驾驶系统中模拟类人驾驶环境。此外,我们开发了三种互补的范式来利用 NavigScene:(1) 导航引导推理,通过将导航上下文纳入提示方法来增强视觉语言模型;(2) 导航引导偏好优化,这是一种强化学习方法,扩展了直接偏好优化,通过建立对导航相关摘要信息的偏好来改进视觉语言模型的响应;(3) 导航引导视觉-语言-动作模型,通过特征融合将导航引导和视觉语言模型与传统驾驶模型相结合。大量实验表明,通过实现超视距推理能力并提高对多样化驾驶场景的泛化能力,我们的方法显著提升了感知、预测、规划和问答任务的性能。这项工作代表了迈向更全面自动驾驶系统的重要一步,该系统能够以更高的可靠性和安全性在复杂、陌生的环境中导航。

关键词

引用

@article{arxiv.2507.05227,
  title  = {NavigScene: Bridging Local Perception and Global Navigation for Beyond-Visual-Range Autonomous Driving},
  author = {Qucheng Peng and Chen Bai and Guoxiang Zhang and Bo Xu and Xiaotong Liu and Xiaoyin Zheng and Chen Chen and Cheng Lu},
  journal= {arXiv preprint arXiv:2507.05227},
  year   = {2025}
}

备注

Accepted by ACM Multimedia 2025