中文

CodedVTR:基于码本的带几何引导的稀疏体素Transformer

计算机视觉与模式识别 2022-03-29 v2

摘要

Transformer在众多2D视觉任务中超越卷积神经网络而备受关注。然而,其存在泛化问题,并依赖大规模预训练与复杂的训练技巧。当应用于3D任务时,不规则的数据结构与有限的数据规模进一步增加了Transformer应用的难度。我们提出CodedVTR(基于码本的体素Transformer,Codebook-based Voxel TRansformer),以提升3D稀疏体素Transformer的数据效率与泛化能力。一方面,我们提出基于码本的注意力,将注意力空间投影到由可学习码本中“原型”组合所表示的子空间,从而正则化注意力学习并提升泛化能力。另一方面,我们提出几何感知自注意力,利用几何信息(几何模式、密度)引导注意力学习。CodedVTR可嵌入现有基于稀疏卷积的方法中,为室内与室外3D语义分割任务带来一致的性能提升。

关键词

引用

@article{arxiv.2203.09887,
  title  = {CodedVTR: Codebook-based Sparse Voxel Transformer with Geometric Guidance},
  author = {Tianchen Zhao and Niansong Zhang and Xuefei Ning and He Wang and Li Yi and Yu Wang},
  journal= {arXiv preprint arXiv:2203.09887},
  year   = {2022}
}

备注

Published at CVPR2022