中文

DriveMRP: 利用合成运动数据增强视觉语言模型的运动风险预测能力

计算机视觉与模式识别 2025-07-15 v3 人工智能 机器人学

摘要

自动驾驶在大量真实世界数据的驱动下取得了显著进展。然而,在长尾场景中,由于动态环境的不确定性和数据覆盖范围的限制,准确预测自车未来运动的安全性仍然是一个主要挑战。在这项工作中,我们旨在探索是否可以通过合成高风险运动数据来增强视觉语言模型(VLM)的运动风险预测能力。具体来说,我们引入了一种基于鸟瞰图(BEV)的运动模拟方法,从自车、其他车辆和环境三个方面对风险进行建模。这使得我们能够合成适用于VLM训练的即插即用型高风险运动数据,我们称之为DriveMRP-10K。此外,我们设计了一个与VLM无关的运动风险估计框架,命名为DriveMRP-Agent。该框架包含一种新颖的全局上下文、自车视角和轨迹投影信息注入策略,使VLM能够有效推理运动路径点与环境之间的空间关系。大量实验表明,通过使用DriveMRP-10K进行微调,我们的DriveMRP-Agent框架能够显著提升多个VLM基线的运动风险预测性能,事故识别准确率从27.13%飙升至88.03%。此外,在内部真实世界高风险运动数据集上进行零样本评估时,DriveMRP-Agent实现了显著的性能飞跃,准确率从基础模型的29.42%提升至68.50%,这展示了我们方法在真实场景中的强大泛化能力。

关键词

引用

@article{arxiv.2507.02948,
  title  = {DriveMRP: Enhancing Vision-Language Models with Synthetic Motion Data for Motion Risk Prediction},
  author = {Zhiyi Hou and Enhui Ma and Fang Li and Zhiyi Lai and Kalok Ho and Zhanqian Wu and Lijun Zhou and Long Chen and Chitian Sun and Haiyang Sun and Bing Wang and Guang Chen and Hangjun Ye and Kaicheng Yu},
  journal= {arXiv preprint arXiv:2507.02948},
  year   = {2025}
}

备注

12 pages, 4 figures. Code available at https://github.com/hzy138/DriveMRP