GARNet:全局感知的多视图三维重建网络及其性价比权衡
计算机视觉与模式识别
2023-05-15 v1
摘要
深度学习技术在多视图三维重建任务中取得了巨大进展。目前,大多数主流方案以组装 2D 编码器与 3D 解码器网络作为基本结构来建立视图与物体形状之间的映射,同时采用不同方法实现多视图特征的聚合。其中,基于注意力融合的方法表现优于其他方法且更稳定,然而其仍存在明显缺陷——在预测融合权重时各视图的强独立性导致缺乏对全局状态的适应。本文提出一种全局感知的基于注意力的融合方法,其建立各分支与全局之间的关联,为权重推断提供全面基础。为增强网络能力,我们引入一种新颖的损失函数以监督形状整体,并提出一种动态两阶段训练策略,可有效适配所有基于注意力融合的重建器。在 ShapeNet 上的实验验证了我们的方法优于现有 SOTA 方法,而参数量远少于同类算法 Pix2Vox++。此外,我们提出一种基于最大化多样性的视图约简方法,并讨论了模型的性价比权衡,以在面临大量输入与有限计算成本时取得更优性能。
引用
@article{arxiv.2211.02299,
title = {GARNet: Global-Aware Multi-View 3D Reconstruction Network and the Cost-Performance Tradeoff},
author = {Zhenwei Zhu and Liying Yang and Xuxin Lin and Chaohao Jiang and Ning Li and Lin Yang and Yanyan Liang},
journal= {arXiv preprint arXiv:2211.02299},
year = {2023}
}