Fisheye3R: 使统一三维前馈基础模型适应鱼眼镜头
计算机视觉与模式识别
2026-04-01 v1
摘要
用于多视图三维重建的前馈基础模型已在透视图像的大规模数据集上训练;当在宽视场图像(例如来自鱼眼相机)上测试时,它们的性能会下降。它们的误差源于由于将三维点映射到二维图像平面的非线性投影模型导致的像素空间位置变化。虽然人们可能推测在鱼眼图像上训练可以解决这个问题,但具有真实标注的鱼眼图像远少于透视图像,这限制了泛化能力。为了能够对表现出高径向畸变的图像进行推理,我们提出了Fisheye3R,一种新颖的适应框架,它扩展了这些多视图三维重建基础模型,使其原生地适应鱼眼输入,同时在透视图像上不出现性能退化。为了解决鱼眼图像和真实标注的稀缺性,我们引入了灵活的学习方案,支持仅使用未标记的透视图像进行自监督适应,以及无需任何鱼眼训练数据的监督适应。在包括VGGT、和MapAnything在内的三个基础模型上的大量实验表明,我们的方法在鱼眼图像上持续改善了相机姿态、深度、点图和视场角估计。
引用
@article{arxiv.2603.28896,
title = {Fisheye3R: Adapting Unified 3D Feed-Forward Foundation Models to Fisheye Lenses},
author = {Ruxiao Duan and Erin Hong and Dongxu Zhao and Eric Turner and Alex Wong and Yunwen Zhou},
journal= {arXiv preprint arXiv:2603.28896},
year = {2026}
}