使用冻结基础模型(DINOv2 和 Metric3Dv2)重访鸟瞰视角感知模型
计算机视觉与模式识别
2025-01-15 v1
摘要
鸟瞰视角感知模型需要大量数据才能有效运行并实现良好泛化。虽然传统数据集常常提供来自多地点的丰富驾驶场景,但这种情况并非总是如此。最大化利用现有训练数据的效用至关重要。随着大型基础模型如 DINOv2 和 Metric3Dv2 的出现,一个值得关注的问题是:这些模型能否被集成到现有模型架构中,不仅能减少所需的训练数据,还能超越当前模型的性能?我们选择两个车辆分割领域的模型架构进行改造:Lift-Splat-Shoot 和 Simple-BEV。对于 Lift-Splat-Shoot,我们探索了使用冻结 DINOv2 进行特征提取和 Metric3Dv2 进行深度估计的实现,其中我们通过仅使用一半的训练数据和迭代次数,显著超越了基线结果,提升了7.4个 IoU。此外,我们引入了 Metric3Dv2 深度信息作为伪LiDAR点云集成到 Simple-BEV 架构中,取代传统LiDAR。这一集成相对于仅使用摄像机的模型实现了+3 IoU 的改进。
引用
@article{arxiv.2501.08118,
title = {Revisiting Birds Eye View Perception Models with Frozen Foundation Models: DINOv2 and Metric3Dv2},
author = {Seamie Hayes and Ganesh Sistu and Ciarán Eising},
journal= {arXiv preprint arXiv:2501.08118},
year = {2025}
}
备注
Accepted for publication at the Electronic Imaging - Autonomous Vehicles and Machines Connference 2025