中文

利用扩张交叉注意力在各种光照下实现一致的深度预测

计算机视觉与模式识别 2021-12-16 v1

摘要

在本文中,我们旨在解决复杂场景下各种光照条件下一致深度预测的问题。现有的基于 RGB-D 传感器或虚拟渲染的室内数据集有两个关键局限——稀疏深度图(NYU Depth V2)和非真实光照(SUN CG、SceneNet RGB-D)。我们提出使用互联网 3D 室内场景并手动调节其光照,以渲染照片级真实的 RGB 图像及其对应的深度图和 BRDF 图,从而获得一个名为 Vari 数据集的新室内深度数据集。我们提出了一个名为 DCA 的简单卷积块,通过对编码特征应用深度可分离扩张卷积来处理全局信息并减少参数量。我们在这些扩张特征上执行交叉注意力,以在不同光照下保持深度预测的一致性。我们的方法通过与当前最先进方法在 Vari 数据集上比较进行评估,实验中观察到显著改进。我们还进行了消融研究,在 NYU Depth V2 上微调模型,并在真实世界数据上评估,以进一步验证我们 DCA 块的有效性。代码、预训练权重和 Vari 数据集均已开源。

关键词

引用

@article{arxiv.2112.08006,
  title  = {Consistent Depth Prediction under Various Illuminations using Dilated Cross Attention},
  author = {Zitian Zhang and Chuhua Xian},
  journal= {arXiv preprint arXiv:2112.08006},
  year   = {2021}
}

备注

14 pages