从点到块:使自注意力可用于三维形状识别
计算机视觉与模式识别
2022-04-11 v1
摘要
尽管 Transformer 架构已在机器学习领域无处不在,但将其适配于三维形状识别并非易事。由于其二次计算复杂度,随着输入点集增大,自注意力算子很快变得低效。此外,我们发现注意力机制难以在全局尺度上找到单个点之间有用的关联。为缓解这些问题,我们提出了一种两阶段 Point Transformer-in-Transformer(Point-TnT)方法,其结合局部与全局注意力机制,使单个点与点块能够高效地相互关注。在形状分类上的实验表明,相比基线 Transformer,该方法为下游任务提供了更有用的特征,同时计算效率更高。此外,我们还将该方法扩展至用于场景重建的特征匹配,表明其可与现有场景重建流程结合使用。
引用
@article{arxiv.2204.03957,
title = {Points to Patches: Enabling the Use of Self-Attention for 3D Shape Recognition},
author = {Axel Berg and Magnus Oskarsson and Mark O'Connor},
journal= {arXiv preprint arXiv:2204.03957},
year = {2022}
}
备注
Accepted to the 26th International Conference on Pattern Recognition