中文

3D 点云 Transformer 架构真正所需的 Token 数量?

计算机视觉与模式识别 2025-11-10 v1 机器学习

摘要

近期在 3D 点云变换器上的进展已在语义分割和重建等任务中达到领先水平。然而,这些模型通常依赖稠密的 token 表示,在训练和推理过程中会带来高额的计算和内存成本。本文发现,token 具有极大的冗余性,导致计算效率极度低下。我们提出了 gitmerge3D—a 基于全局信息图谱的 token 合并方法,可将 token 数量最多降低 90-95%,同时保持竞争的性能。本发现挑战了“更多 token 必然带来更好性能”的主流假设,凸显当前许多模型存在过度 token 化和可扩展性不足的问题。我们在多个 3D 视觉任务上验证了该方法,显示出一致的计算效率提升。本文是首次对大规模 3D 变换器模型中的冗余性进行评估,为开发更高效的 3D 基础架构提供了洞见。我们的代码和模型权重已公开提供于 https://gitmerge3d.github.io

关键词

引用

@article{arxiv.2511.05449,
  title  = {How Many Tokens Do 3D Point Cloud Transformer Architectures Really Need?},
  author = {Tuan Anh Tran and Duy M. H. Nguyen and Hoai-Chau Tran and Michael Barz and Khoa D. Doan and Roger Wattenhofer and Ngo Anh Vien and Mathias Niepert and Daniel Sonntag and Paul Swoboda},
  journal= {arXiv preprint arXiv:2511.05449},
  year   = {2025}
}

备注

Accepted at NeurIPS 2025