基于Transformer的多视图三维重建
计算机视觉与模式识别
2021-03-25 v1
摘要
基于深度CNN的方法迄今在多视图三维物体重建中取得了最先进的成果。尽管取得了可观进展,这些方法的两个核心模块——多视图特征提取与融合——通常被分别研究,且不同视图间的物体关系很少被探索。本文受近期基于自注意力的Transformer模型巨大成功的启发,将多视图三维重建重新表述为序列到序列的预测问题,并针对该任务提出一个名为三维体素Transformer(VolT)的新框架。与以往使用分离设计的CNN方法不同,我们将特征提取与视图融合统一在单一Transformer网络中。我们设计的天然优势在于利用多个无序输入间的自注意力来探索视图到视图的关系。在大规模三维重建基准数据集ShapeNet上,我们的方法以少于其他CNN方法(更少)的参数实现了多视图重建的新最先进精度。实验结果也表明了我们方法的强扩展能力。我们的代码将公开可用。
引用
@article{arxiv.2103.12957,
title = {Multi-view 3D Reconstruction with Transformer},
author = {Dan Wang and Xinrui Cui and Xun Chen and Zhengxia Zou and Tianyang Shi and Septimiu Salcudean and Z. Jane Wang and Rabab Ward},
journal= {arXiv preprint arXiv:2103.12957},
year = {2021}
}