中文

Volume Transformer:重新审视用于3D场景理解的原始Transformer

计算机视觉与模式识别 2026-04-22 v1

摘要

Transformer已成为深度学习领域的通用基础,然而3D场景理解仍依赖于带有强领域先验的专用骨干网络。这使得该领域与更广泛的Transformer生态相隔离,限制了新进展的迁移以及日益优化的软硬件栈所带来的收益。为弥合这一差距,我们以最小的修改将原始Transformer编码器适配于3D场景。给定输入3D场景,我们将其划分为体素块token,使用全局自注意力进行处理,并通过旋转位置嵌入的3D扩展注入位置信息。我们将所得模型称为Volume Transformer (Volt),并将其应用于3D语义分割。在标准3D基准上直接训练Volt会导致捷径学习,凸显了当前3D监督规模的局限性。为克服此问题,我们引入了一种数据高效的训练方案,其基于强3D数据增强、正则化以及来自卷积教师的蒸馏,使Volt与SOTA方法具有竞争力。随后,我们通过在多个数据集上进行联合训练来扩大监督规模,并表明与领域特定的3D骨干网络相比,Volt从规模扩大中获益更多,在室内和室外数据集上均取得了SOTA结果。最后,当作为标准3D实例分割流程中的直接替换骨干网络时,Volt再次刷新了SOTA,凸显了其作为3D场景理解中简单、可扩展且通用的骨干网络的潜力。

关键词

引用

@article{arxiv.2604.19609,
  title  = {Volume Transformer: Revisiting Vanilla Transformers for 3D Scene Understanding},
  author = {Kadir Yilmaz and Adrian Kruse and Tristan Höfer and Daan de Geus and Bastian Leibe},
  journal= {arXiv preprint arXiv:2604.19609},
  year   = {2026}
}

备注

Project page: https://vision.rwth-aachen.de/Volt