中文

我们能否从二维视觉Transformer出发解决三维视觉任务?

计算机视觉与模式识别 2022-09-20 v2 人工智能

摘要

Vision Transformers (ViTs) 已被证明在通过大规模图像数据集训练解决二维图像理解任务方面是有效的;同时,作为某种独立的路线,在建模三维视觉世界(如体素或点云)方面也同样有效。然而,随着人们日益期望 transformer 能成为异构数据的“通用”建模工具,用于二维和三维任务的 ViT 迄今采用了差异极大的架构设计,几乎难以迁移。这引出了一个(过于)宏大的问题:我们能否缩小二维与三维 ViT 架构之间的差距?作为一项试点研究,本文展示了使用标准二维 ViT 架构理解三维视觉世界的可喜前景,仅在输入和输出层面做最小定制化,而无需重新设计流水线。为从二维 ViT 构建三维 ViT,我们对 patch embedding 和 token 序列进行“膨胀”,并配以匹配三维数据几何结构的新位置编码机制。由此产生的“极简”三维 ViT 名为 Simple3D-Former,与高度定制化的三维专用设计相比,在物体分类、点云分割和室内场景检测等流行三维任务上表现得出奇稳健。因此,它可作为新三维 ViT 的强基线。此外,我们注意到,追求统一的二维-三维 ViT 设计除了科学好奇心外还具有实际意义。具体而言,我们证明 Simple3D-Former 天然能够利用来自大规模真实二维图像(如 ImageNet)的丰富预训练权重,这些权重可直接插入以提升三维任务性能而“无需额外代价”。

关键词

引用

@article{arxiv.2209.07026,
  title  = {Can We Solve 3D Vision Tasks Starting from A 2D Vision Transformer?},
  author = {Yi Wang and Zhiwen Fan and Tianlong Chen and Hehe Fan and Zhangyang Wang},
  journal= {arXiv preprint arXiv:2209.07026},
  year   = {2022}
}