中文

基于教师-学生学习的无标签数据实时多视角全景深度估计

计算机视觉与模式识别 2025-11-11 v2 机器人学

摘要

全景深度估计可实现对整个 360 度范围内的 3D 感知。然而,在自动驾驶和机器人等实际应用中,现有算法在实现实时性能和稳健的跨场景泛化方面仍面临重大挑战。本文提出一种用于边缘计算平台的实时全景深度估计方法,命名为 Rt-OmniMVS,引入组合球面扫掠方法并实现轻量级网络结构,以在边缘计算平台上实现实时性能。为实现高精度、稳健性和在实际环境中的泛化能力,我们引入教师-学生学习策略。我们利用高精度立体匹配方法作为教师模型,对无标签的真实世界数据生成伪标签,并通过数据和模型增强技术进行训练以提升学生模型 Rt-OmniMVS 的性能。我们还提出了 HexaMODE,这是一种基于多视角鱼眼摄像头和边缘计算设备的全景深度感知系统。收集了大规模混合数据集,包含无标签的真实世界数据和合成数据用于模型训练。在公开数据集上的实验表明,所提方法在显著降低资源消耗的同时,达到与当前最先进方法相当的效果。所提系统和算法在各种复杂的真实场景中(室内外)均表现出高精度,在边缘计算平台上实现约 15 帧/秒的推理速度。

关键词

引用

@article{arxiv.2409.07843,
  title  = {Real-time Multi-view Omnidirectional Depth Estimation for Real Scenarios based on Teacher-Student Learning with Unlabeled Data},
  author = {Ming Li and Xiong Yang and Chaofan Wu and Jiaheng Li and Pinzhi Wang and Xuejiao Hu and Sidan Du and Yang Li},
  journal= {arXiv preprint arXiv:2409.07843},
  year   = {2025}
}