LitePT:更轻量且更强的点变换器
计算机视觉与模式识别
2026-03-31 v2
摘要
现代用于三维点云处理的神经网络架构同时包含卷积层和注意力模块,但如何组装它们仍是未解之谜。我们分析了三维点云网络中不同计算模块的作用,发现了一种直观的行为:卷积足以在早期层的高分辨率下提取低层几何信息,而注意力在此处代价高昂且无益;注意力在低分辨率的深层中更高效地捕捉高层语义和上下文,而卷积会膨胀参数数量。基于这一设计原则,我们提出了一种新的改进型三维点云骨干网络,在早期阶段使用卷积,在深层切换为注意力。为避免丢弃冗余卷积层时空间布局信息的丢失,我们引入了一种新颖的无参数三维位置编码PointROPE。 resulting LitePT模型的参数量减少3.6倍,运行速度提升2倍,内存使用减少2倍,但在多种任务和数据集上仍匹配或超越了最先进的Point Transformer V3。代码和模型可在以下地址获取:https://github.com/prs-eth/LitePT。
引用
@article{arxiv.2512.13689,
title = {LitePT: Lighter Yet Stronger Point Transformer},
author = {Yuanwen Yue and Damien Robert and Jianyuan Wang and Sunghwan Hong and Jan Dirk Wegner and Christian Rupprecht and Konrad Schindler},
journal= {arXiv preprint arXiv:2512.13689},
year = {2026}
}
备注
CVPR 2026, Project page: https://litept.github.io/