基于注意力的单图像三维物体重建
计算机视觉与模式识别
2020-08-12 v1
摘要
近年来,基于学习的从二维图像进行三维重建的方法因其现代应用(如3D打印机、自主机器人、自动驾驶汽车、虚拟现实和增强现实)而受到关注。计算机视觉界已付出巨大努力开发用于重建物体与场景完整三维几何形状的函数。然而,在提取图像特征时,它们依赖于卷积神经网络,后者在捕获长程依赖方面效率低下。本文中,我们提出对最先进的三维物体重建方法 Occupancy Networks 进行实质性改进。为此,我们在网络编码器中应用自注意力机制,以利用互补的输入特征而非基于局部区域的特征,帮助编码器提取全局信息。通过我们的方法,我们能够将原工作在网格交并比(mesh IoU)上提升 5.05%、法向一致性(Normal Consistency)上提升 0.83%,并将倒角-L1距离(Chamfer-L1 distance)提升超过10倍。我们还进行了定性研究,表明我们的方法能够生成一致性高得多的网格,证实了其相对于当前最先进方法的泛化能力增强。
引用
@article{arxiv.2008.04738,
title = {Attention-based 3D Object Reconstruction from a Single Image},
author = {Andrey Salvi and Nathan Gavenski and Eduardo Pooch and Felipe Tasoniero and Rodrigo Barros},
journal= {arXiv preprint arXiv:2008.04738},
year = {2020}
}
备注
8 pages, 4 figures, 3 tables