中文

面向自动驾驶视觉问答的VLM辅助持续学习

计算机视觉与模式识别 2025-12-09 v2

摘要

本文提出了一种通过将视觉-语言模型(VLMs)与持续学习相结合来解决自动驾驶中视觉问答(VQA)任务的新方法。在自动驾驶中,VQA在使系统理解并推理其周围环境方面起着至关重要的作用。然而,当传统模型顺序接触新的驾驶任务(如感知、预测和规划,每个任务都需要不同形式的知识)时,常常会遭遇灾难性遗忘。为应对这一挑战,我们提出了一种新颖的持续学习框架,该框架将VLMs与选择性记忆回放和知识蒸馏相结合,并通过任务特定的投影层正则化进行强化。知识蒸馏允许先前训练的模型充当“教师”,指导模型完成后续任务,从而最大限度地减少遗忘。同时,任务特定的投影层基于特征表示的差异计算损失,确保学习的连续性并减少任务间的偏移。在DriveLM数据集上的评估表明,我们的框架显示出显著的性能提升,在各种指标上的增益范围从20.11%到35.16%不等。这些结果突显了将持续学习与VLMs相结合在增强自动驾驶VQA系统的鲁棒性和可靠性方面的有效性。我们将发布源代码。

关键词

引用

@article{arxiv.2502.00843,
  title  = {VLM-Assisted Continual learning for Visual Question Answering in Self-Driving},
  author = {Yuxin Lin and Mengshi Qi and Liang Liu and Huadong Ma},
  journal= {arXiv preprint arXiv:2502.00843},
  year   = {2025}
}