中文

一种带姿态嵌入的全局深度范围无关多视角立体视觉Transformer网络

计算机视觉与模式识别 2024-12-10 v2

摘要

本文提出了一种新型多视角立体视觉(MVS)框架,摆脱了深度范围先验。与近期工作的无先验MVS方法以成对方式不同,我们的方法同时考虑所有源图像。具体而言,我们引入了一种多视角视差注意力(MDA)模块,用于聚合多视角图像内部及跨图像的长程上下文信息。考虑到极线视差流的非对称性,该方法的关键在于精确建模多视角几何约束。我们整合姿态嵌入以封装多视角相机姿态等信息,为以注意力为主导的多视角视差特征融合提供隐式几何约束。此外,由于同一像素在参考帧中跨多个源帧的观测质量存在显著差异,我们为每个源图像构建了相应的隐状态。我们显式估计当前像素对应于源图像极线上采样点的质量,并通过不确定性估计模块动态更新隐状态。在DTU数据集和Tanks&Temple基准测试上的大量实验结果证明了该方法的有效性。代码可在项目页面获取:https://zju3dv.github.io/GD-PoseMVS/。

关键词

引用

@article{arxiv.2411.01893,
  title  = {A Global Depth-Range-Free Multi-View Stereo Transformer Network with Pose Embedding},
  author = {Yitong Dong and Yijin Li and Zhaoyang Huang and Weikang Bian and Jingbo Liu and Hujun Bao and Zhaopeng Cui and Hongsheng Li and Guofeng Zhang},
  journal= {arXiv preprint arXiv:2411.01893},
  year   = {2024}
}