中文

将朴素 Transformer 应用于真实世界点云

计算机视觉与模式识别 2023-08-08 v3

摘要

为将基于 transformer 的模型应用于点云理解,许多先前工作通过例如局部注意力和下采样来修改 transformer 的架构。尽管取得了有前景的结果,早期的点云 transformer 工作存在两个问题。首先,朴素 transformer 的能力仍未被充分探索。其次,它们聚焦于简单且小的点云而非复杂的真实世界点云。本工作重新审视了朴素 transformer 在真实世界点云理解中的应用。我们首先更细致地考察朴素 transformer 的一些基本组件,例如分块器和位置嵌入,以兼顾效率与性能。为弥补因缺乏归纳偏置和标注数据带来的性能差距,我们研究了基于掩码自编码器(MAE)的自监督预训练。具体而言,我们提出丢弃块(drop patch),其防止信息泄露并显著提升 MAE 的有效性。我们的模型在 S3DIS 数据集的语义分割和 ScanNet 数据集的目标检测上以更低计算成本取得了 SOTA 结果。我们的工作为未来点云 transformer 研究提供了新基线。

关键词

引用

@article{arxiv.2303.00086,
  title  = {Applying Plain Transformers to Real-World Point Clouds},
  author = {Lanxiao Li and Michael Heizmann},
  journal= {arXiv preprint arXiv:2303.00086},
  year   = {2023}
}