中文

SAT:用于三维点云语义分割的尺寸感知 Transformer

计算机视觉与模式识别 2023-01-18 v1

摘要

Transformer 模型在点云分割中取得了令人瞩目的性能。然而,大多数现有的注意力机制对所有点同等对待,提供了相同的特征学习范式,忽略了场景物体之间巨大的尺寸差异。在本文中,我们提出了尺寸感知 Transformer(Size-Aware Transformer, SAT),能够为不同尺寸的物体定制有效的感受野。我们的 SAT 通过两步实现尺寸感知学习:在每个注意力层中引入多尺度特征,并允许每个点自适应地选择其注意力范围。它包含两个关键设计:多粒度注意力(Multi-Granularity Attention, MGA)机制和 Re-Attention 模块。MGA 解决了两个挑战:高效地聚合来自远处区域的 token,以及在一个注意力层内保留多尺度特征。具体而言,提出了点-体素交叉注意力来解决第一个挑战,并应用基于标准多头自注意力的分流策略来解决第二个挑战。Re-Attention 模块为每个点动态调整 MGA 输出的细粒度和粗粒度特征的注意力分数。大量实验结果表明,SAT 在 S3DIS 和 ScanNetV2 数据集上取得了 SOTA 性能。在所有对比方法中,我们的 SAT 在各类别上也取得了最均衡的性能,这说明了建模不同尺寸类别的优越性。我们的代码和模型将在本文被接收后发布。

关键词

引用

@article{arxiv.2301.06869,
  title  = {SAT: Size-Aware Transformer for 3D Point Cloud Semantic Segmentation},
  author = {Junjie Zhou and Yongping Xiong and Chinwai Chiu and Fangyu Liu and Xiangyang Gong},
  journal= {arXiv preprint arXiv:2301.06869},
  year   = {2023}
}