PointMT:基于混合 MLP-Transformer 架构的高效点云分析
计算机视觉与模式识别
2024-09-17 v2
摘要
近年来,基于变换器架构的点云分析方法取得了显著进展,尤其是在3D建模、虚拟现实和自动驾驶等多媒体应用中。然而,变换器架构对计算资源的高需求阻碍了其可扩展性、实时处理能力以及在资源受限移动设备和其他平台上的部署。这一限制仍是实现端侧智能和多媒体处理实际应用的重大障碍。为此,我们提出了一种高效点云分析架构,称为点 MLP-Transformer(PointMT)。本研究通过引入线性复杂度的局部注意力机制来解决自注意力机制的二次复杂度,从而实现有效的特征聚合。此外,为抵消变换器侧重标记差异而忽视通道差异的倾向,我们引入一种无参数的通道温度自适应机制,自适应调整每个通道的注意力权重分布,增强特征聚合的精确度。为提高变换器由于点云数据集规模受限而导致的慢收敛速度,我们提出了MLP-变换器混合模块,显著提升了模型的收敛速度。此外,为提升点标记的特征表示能力,我们改进了分类头,使点标记能够直接参与预测。实验结果表明,在多个评估基准上,PointMT 在性能上与最先进的方法相当,同时在性能和精度之间实现了最佳平衡。
引用
@article{arxiv.2408.05508,
title = {PointMT: Efficient Point Cloud Analysis with Hybrid MLP-Transformer Architecture},
author = {Qiang Zheng and Chao Zhang and Jian Sun},
journal= {arXiv preprint arXiv:2408.05508},
year = {2024}
}