中文

具有注意力薄代价体的多视图立体网络

计算机视觉与模式识别 2022-07-19 v2

摘要

我们提出一种高效的多视图立体(MVS)网络,用于从多张RGB图像推断深度值。近期研究表明,将真实空间中的几何关系映射到神经网络是MVS问题的关键课题。具体而言,这些方法聚焦于如何通过构建良好的代价体来表达不同视图间的对应关。本文中,我们在吸收既往经验的基础上提出一种更完备的代价体构建方法。首先,我们引入自注意力机制以充分聚合输入图像中的主导信息并准确建模长程依赖,从而选择性地聚合参考特征。其次,我们将组间相关引入特征聚合,大幅降低了内存与计算负担,同时增强了不同特征通道间的信息交互。借此构建了更轻量且高效的代价体。最后我们遵循由粗到细策略,在不确定性估计辅助下逐尺度精炼深度采样范围,并结合前述步骤得到注意力薄代价体(attention thin volume)。定量与定性实验表明了本模型的性能。

关键词

引用

@article{arxiv.2110.08556,
  title  = {Multi-View Stereo Network with attention thin volume},
  author = {Zihang Wan},
  journal= {arXiv preprint arXiv:2110.08556},
  year   = {2022}
}