MeT:一种用于三维网格语义分割的图 Transformer
计算机视觉与模式识别
2023-07-04 v1 图形学
摘要
多边形网格因其捕获非均匀形状时的效率与高灵活性,已成为离散逼近三维形状的标准。然而,这种非均匀性导致网格结构的不规则,使得三维网格分割等任务尤为困难。三维网格语义分割通常通过基于 CNN 的方法解决,取得了良好精度。近来,Transformer 在 NLP 与计算机视觉领域均获得足够关注,取得了至少与 CNN 模型相当的性能,支持了人们长期寻求的架构通用性。顺应此趋势,我们提出一种基于 Transformer 的三维网格语义分割方法,其动机是通过全局注意力机制更好地建模网格的图结构。为解决标准 Transformer 架构在建模如三维网格等非序列数据的相对位置以及捕捉局部上下文方面的局限,我们通过邻接矩阵的拉普拉斯特征向量进行位置编码以取代传统的正弦位置编码,并将基于聚类的特征引入自注意力与交叉注意力算子。在 Shape COSEG 数据集的三组集合、Maron 等人 2017 年提出的人体分割数据集以及 ShapeNet 基准上开展的实验结果表明,所提方法在三维网格语义分割上取得了最先进的性能。
引用
@article{arxiv.2307.01115,
title = {MeT: A Graph Transformer for Semantic Segmentation of 3D Meshes},
author = {Giuseppe Vecchio and Luca Prezzavento and Carmelo Pino and Francesco Rundo and Simone Palazzo and Concetto Spampinato},
journal= {arXiv preprint arXiv:2307.01115},
year = {2023}
}