BRIDGE——面向单目深度估计的强化学习深度到图像数据生成引擎
计算机视觉与模式识别
2025-10-01 v2 人工智能
摘要
单目深度估计(Monocular Depth Estimation,MDE)是计算机视觉的基础任务。传统方法受限于数据稀缺和质量问题,限制了其鲁棒性。为克服此困难,我们提出BRIDGE,一个基于强化学习优化的深度到图像(Depth-to-Image,D2I)生成框架,合成超过2000万个真实且几何准确的RGB图像,每张图像都有其真实的深度图。随后,我们在该数据集上训练深度估计模型,采用混合监督策略,将教师伪标签与真实深度图结合,以实现全面且稳健的训练。这种创新的数据生成和训练范式使BRIDGE在规模和领域多样性方面实现突破,持续优于现有最先进方法,表现出色,尤其在复杂场景细节捕获方面,从而促进了通用且稳健的深度特征学习。代码和模型已公开:https://dingning-liu.github.io/bridge.github.io/。
引用
@article{arxiv.2509.25077,
title = {BRIDGE -- Building Reinforcement-Learning Depth-to-Image Data Generation Engine for Monocular Depth Estimation},
author = {Dingning Liu and Haoyu Guo and Jingyi Zhou and Tong He},
journal= {arXiv preprint arXiv:2509.25077},
year = {2025}
}
备注
20 pages, 7 figures