中文

Pointy - A Lightweight Transformer for Point Cloud Foundation Models

计算机视觉与模式识别 2026-04-21 v1 机器学习

摘要

点云基础模型最近在能力上不断提升,往往依赖于来自语言或视觉的大规模表示学习。本文采用更可控的方法,引入一种轻量级基于 Transformer 的点云架构。与Heavy reliance on cross-modal supervision 不同,我们的模型仅使用 39k 个点云进行训练,却超过了在 20 万多个训练样本上训练的几个较大基础模型。值得注意的是,我们的方法接近使用超过 100 万个点云、图像和文本样本的 SOTA 结果,表明 carefully curated training setup 和 architecture 的价值。为确保严格评估,我们进行了全面的复制研究,标准化了多个点云架构的训练 regime 和基准测试。这种统一的实验框架隔离了架构选择的影响,允许透明比较,凸显了我们设计和其他无 tokenizer 架构的优势。我们的结果表明,简单 backbone 也能为更复杂或数据丰富的策略提供具竞争力的结果。实现包括代码、预训练模型和训练协议,已在 https://github.com/KonradSzafer/Pointy 提供。

关键词

引用

@article{arxiv.2603.10963,
  title  = {Pointy - A Lightweight Transformer for Point Cloud Foundation Models},
  author = {Konrad Szafer and Marek Kraft and Dominik Belter},
  journal= {arXiv preprint arXiv:2603.10963},
  year   = {2026}
}

备注

To appear in the proceedings of ACIVS 2025. An earlier version was presented at the SCI-FM workshop at ICLR 2025