用于多视图三维重建的长程分组Transformer
计算机视觉与模式识别
2023-08-21 v1
摘要
如今,transformer网络已在许多计算机视觉任务中展现出优越性能。在遵循该范式的多视图三维重建算法中,自注意力处理在面对大量视图输入时不得不处理包含海量信息的复杂图像令牌。信息量的诅咒导致模型学习极度困难。为缓解此问题,近期方法压缩表示每视图的令牌数或丢弃不同视图令牌间的注意力操作。显然,它们对性能有负面影响。因此,我们提出基于分治原则的长程分组注意力(LGA)。来自所有视图的令牌被分组以进行独立注意力操作。每组中的令牌从所有视图采样,可为其所在视图提供宏观表示。不同组间的多样性保证了特征学习的丰富性。可建立高效且有效的编码器,其利用LGA连接视图间特征,并利用标准自注意力层提取视图内特征。此外,还设计了新颖的渐进上采样解码器用于生成较高分辨率的体素。基于此,我们构建了强大的基于transformer的网络,称为LRGT。在ShapeNet上的实验结果验证了我们的方法在多视图重建中达到SOTA精度。代码将发布于 https://github.com/LiyingCV/Long-Range-Grouping-Transformer。
引用
@article{arxiv.2308.08724,
title = {Long-Range Grouping Transformer for Multi-View 3D Reconstruction},
author = {Liying Yang and Zhenwei Zhu and Xuxin Lin and Jian Nong and Yanyan Liang},
journal= {arXiv preprint arXiv:2308.08724},
year = {2023}
}
备注
Accepted to ICCV 2023