基于变换器的 textured non-manifold 3D 网格语义分割
计算机视觉与模式识别
2026-04-03 v1
摘要
带纹理的 3D 网格同时代表几何、拓扑与外观信息,但其不规则的结构为基于深度学习的语义分割带来了显著挑战。虽然已有少数方法直接作用于网格且不施加几何约束,但通常忽略了这些网格还提供的丰富纹理信息。我们引入一种纹理感知变换器,直接从每个网格面关联的原始像素中学习,配合一种新的层次学习方案实现多尺度特征聚合。纹理分支将所有面级像素汇聚为可学习的 token,并与几何描述符融合后经过由 Two-Stage Transformer Blocks (TSTB) 组成的堆叠处理,这些块允许局部与全局信息流。我们在 Semantic Urban Meshes (SUM) 基准测试集上评估我们的模型,并构建了一个新的文化遗产数据集,其中包含带有损伤类型三角级别标注的带纹理屋顶瓦。我们的模型在 SUM 上实现了 81.9% 平均 F1 分数和 94.3% 正确率,在新数据集上实现了 49.7% 平均 F1 分数和 72.8% 正确率,显著优于现有方法。
引用
@article{arxiv.2604.01836,
title = {Semantic Segmentation of Textured Non-manifold 3D Meshes using Transformers},
author = {Mohammadreza Heidarianbaei and Max Mehltretter and Franz Rottensteiner},
journal= {arXiv preprint arXiv:2604.01836},
year = {2026}
}