基于位置提示的高效3D表征学习
计算机视觉与模式识别
2025-09-25 v2
摘要
我们重新思考位置编码在3D表征学习和微调中的作用。我们认为,在基于点Transformer的方法中使用位置编码用于聚合点云的多尺度特征。此外,我们从提示词和适配器的视角探索参数高效微调(PEFT),提出一种简单而有效的方法,称为PPT用于点云分析。PPT包含增加的patch token和可训练的位置编码,同时保持大部分预训练模型参数冻结。广泛的实验验证了PPT既有效又高效。我们提出的PEFT方法——PPT仅需1.05万参数即可完成训练,在诸多主流数据集上取得最先进的结果,例如在ScanObjectNN OBJ_BG数据集上达到95.01%的准确率。代码和模型权重将发布于https://github.com/zsc000722/PPT。
关键词
引用
@article{arxiv.2408.11567,
title = {Positional Prompt Tuning for Efficient 3D Representation Learning},
author = {Shaochen Zhang and Zekun Qi and Runpei Dong and Xiuxiu Bai and Xing Wei},
journal= {arXiv preprint arXiv:2408.11567},
year = {2025}
}
备注
Accepted at ACMMM 2025 Oral