中文

利用后验优化轨迹增强大型视觉模型在街景语义理解中的能力

计算机视觉与模式识别 2025-06-03 v2 机器学习 机器人学

摘要

为了提高自动驾驶(AD)感知模型的泛化能力,车辆需要基于持续收集的数据随时间更新模型。随着时间的推移,AD 模型拟合的数据量不断扩大,这有助于大幅提升 AD 模型的泛化能力。然而,这种不断扩大的数据对 AD 模型而言是一把双刃剑。具体而言,当拟合数据量增长并超过 AD 模型的拟合能力时,AD 模型容易出现欠拟合。为解决这一问题,我们提出使用预训练的大型视觉模型作为骨干网络,并结合下游感知头来理解 AD 语义信息。这种设计不仅能凭借 LVMs 强大的拟合能力克服上述欠拟合问题,还能得益于 LVMs 广泛且多样的训练数据来增强感知泛化能力。另一方面,为了减轻车辆在运行 LVM 骨干网络时训练感知头的计算负担,我们引入了后验优化轨迹引导的优化方案以加速收敛。具体而言,我们提出了 POT 生成器,提前生成后验(未来)优化方向以指导当前优化迭代,通过这种方式,模型通常能在 10 个 epoch 内收敛。大量实验表明,与现有的 SOTA 方法相比,所提出的方法将性能提升了 66.48% 以上,收敛速度提高了 6 倍以上。

关键词

引用

@article{arxiv.2501.01710,
  title  = {Enhancing Large Vision Model in Street Scene Semantic Understanding through Leveraging Posterior Optimization Trajectory},
  author = {Wei-Bin Kou and Qingfeng Lin and Ming Tang and Jingreng Lei and Shuai Wang and Rongguang Ye and Guangxu Zhu and Yik-Chung Wu},
  journal= {arXiv preprint arXiv:2501.01710},
  year   = {2025}
}

备注

7 pages