中文

视觉-语言模型在自动驾驶中行人行为与场景理解的应用

计算机视觉与模式识别 2025-07-31 v2 人工智能 机器学习 机器人学

摘要

视觉-语言模型(VLMs)已成为增强自动驾驶感知与决策的一种极具前景的方法。然而,将VLMs应用于理解与行人交互的复杂场景以及高效的车辆部署方面仍存在差距。在本文中,我们提出了一种知识蒸馏方法,将大规模视觉-语言基础模型的知识迁移至高效的视觉网络,并将其应用于行人行为预测和场景理解任务,在生成更多样化和全面的语义属性方面取得了可喜的成果。我们还利用多个预训练模型和集成技术来提升模型性能。我们进一步检验了知识蒸馏后模型的有效性;结果表明,在开放词汇感知和轨迹预测任务中各项指标均有显著提升,这有望增强自动驾驶的端到端性能。

关键词

引用

@article{arxiv.2501.06680,
  title  = {Application of Vision-Language Model to Pedestrians Behavior and Scene Understanding in Autonomous Driving},
  author = {Haoxiang Gao and Li Zhang and Yu Zhao and Zhou Yang and Jinghan Cao},
  journal= {arXiv preprint arXiv:2501.06680},
  year   = {2025}
}