基于跳跃注意力上采样的点云处理软掩码Transformer
计算机视觉与模式识别
2026-01-30 v2
摘要
点云处理方法在特征层面利用局部和全局点特征来服务于下游任务,但在编码阶段往往忽略了点云中固有的任务级上下文。我们认为,将任务级信息整合到编码阶段能显著提升性能。为此,我们提出了SMTransformer,它通过利用由任务级查询和键生成的软掩码来学习注意力权重,从而将任务级信息融入基于向量的Transformer中。此外,为了在分割等高级任务中促进编码层与解码层特征之间的有效通信,我们引入了一个基于跳跃注意力的上采样模块。该模块动态融合来自编码层和解码层不同分辨率点的特征。为缓解上述模块的复杂性所导致的网络参数和训练时间增加,我们提出了一种新颖的共享位置编码策略。该策略允许不同的Transformer模块在相同分辨率点上共享相同的位置信息,从而在不牺牲精度的情况下减少网络参数和训练时间。在多个数据集上与现有方法的实验对比证明了SMTransformer和基于跳跃注意力的上采样在点云处理任务(包括语义分割和分类)中的有效性。特别是,我们在S3DIS Area 5上取得了73.4% mIoU,在SWAN数据集上取得了62.4% mIoU的领先语义分割结果。
引用
@article{arxiv.2403.14124,
title = {Soft Masked Transformer for Point Cloud Processing with Skip Attention-Based Upsampling},
author = {Yong He and Hongshan Yu and Chaoxu Mu and Mingtao Feng and Tongjia Chen and Zechuan Li and Anwaar Ulhaq and Ajmal Mian},
journal= {arXiv preprint arXiv:2403.14124},
year = {2026}
}
备注
Conditionally accepted by IEEE Transactions on Automation Science and Engineering