中文

VLM-C4L:基于视觉语言模型的自动驾驶持续核心数据集学习与边界情况优化

机器人学 2025-04-01 v1 机器学习

摘要

随着自动驾驶的广泛采用和部署,处理复杂环境已成为不可避免的挑战。由于极端场景数据集的稀缺性和多样性,当前的自动驾驶模型难以有效处理边界情况。这一限制构成了重大安全风险,据美国国家公路交通安全管理局(NHTSA)称,自动驾驶车辆系统每年在美国发生数百起已报告的碰撞事故,这些事故发生在阳光眩光和雾等边界情况中,并导致了一些致命事故。此外,为了持续维持稳健可靠的自动驾驶系统,模型不仅需要在常规场景中表现良好,还需要适应新出现的场景,尤其是那些偏离常态的边界情况。这需要一种在不降低先前已获能力的情况下增量整合新知识的学习机制。然而,据我们所知,目前尚未提出能够确保自动驾驶中一致且可扩展的边界情况学习的持续学习方法。为了解决这些限制,我们提出了 VLM-C4L,这是一种持续学习框架,引入视觉语言模型(VLM)以动态优化和增强边界情况数据集,并且 VLM-C4L 将 VLM 引导的高质量数据提取与核心数据回放策略相结合,使模型能够从多样化的边界情况中增量学习,同时保持在先前常规场景上的性能,从而确保真实世界自动驾驶中的长期稳定性和适应性。我们在大规模真实世界自动驾驶数据集上评估了 VLM-C4L,包括 Waymo 和边界情况数据集 CODA。

关键词

引用

@article{arxiv.2503.23046,
  title  = {VLM-C4L: Continual Core Dataset Learning with Corner Case Optimization via Vision-Language Models for Autonomous Driving},
  author = {Haibo Hu and Jiacheng Zuo and Yang Lou and Yufei Cui and Jianping Wang and Nan Guan and Jin Wang and Yung-Hui Li and Chun Jason Xue},
  journal= {arXiv preprint arXiv:2503.23046},
  year   = {2025}
}