基于 Transformer 的点云学习
计算机视觉与模式识别
2022-10-26 v2
摘要
Transformer 网络在自然语言处理中的卓越表现促进了这些模型在处理计算机视觉任务(如图像识别与分割)中的发展。在本文中,我们引入一种称为多级多尺度点 Transformer(MLMSPT)的新颖框架,它直接在不规则点云上进行表征学习。具体地,我们研究了一种点金字塔 Transformer 来建模我们所定义的具有不同分辨率或尺度的特征,随后通过多级 Transformer 模块聚合来自每个尺度的不同层级的上下文信息并增强其交互。同时设计了多尺度 Transformer 模块来捕获不同尺度间表征的依赖关系。在公开基准数据集上的大量评估证明了我们的方法在三维形状分类、分割任务上的有效性与竞争性能。
引用
@article{arxiv.2104.13636,
title = {Point Cloud Learning with Transformer},
author = {Qi Zhong and Xian-Feng Han},
journal= {arXiv preprint arXiv:2104.13636},
year = {2022}
}
备注
10 pages, 4 figures