Pointy - A Lightweight Transformer for Point Cloud Foundation Models
计算机视觉与模式识别
2026-04-21 v1 机器学习
摘要
点云基础模型最近在能力上不断提升,往往依赖于来自语言或视觉的大规模表示学习。本文采用更可控的方法,引入一种轻量级基于 Transformer 的点云架构。与Heavy reliance on cross-modal supervision 不同,我们的模型仅使用 39k 个点云进行训练,却超过了在 20 万多个训练样本上训练的几个较大基础模型。值得注意的是,我们的方法接近使用超过 100 万个点云、图像和文本样本的 SOTA 结果,表明 carefully curated training setup 和 architecture 的价值。为确保严格评估,我们进行了全面的复制研究,标准化了多个点云架构的训练 regime 和基准测试。这种统一的实验框架隔离了架构选择的影响,允许透明比较,凸显了我们设计和其他无 tokenizer 架构的优势。我们的结果表明,简单 backbone 也能为更复杂或数据丰富的策略提供具竞争力的结果。实现包括代码、预训练模型和训练协议,已在 https://github.com/KonradSzafer/Pointy 提供。
关键词
引用
@article{arxiv.2603.10963,
title = {Pointy - A Lightweight Transformer for Point Cloud Foundation Models},
author = {Konrad Szafer and Marek Kraft and Dominik Belter},
journal= {arXiv preprint arXiv:2603.10963},
year = {2026}
}
备注
To appear in the proceedings of ACIVS 2025. An earlier version was presented at the SCI-FM workshop at ICLR 2025