面向开放世界三维目标识别的遮挡感知文本-图像-点云预训练
计算机视觉与模式识别
2025-03-25 v2
摘要
最近的开放世界表示学习方法利用CLIP实现了零样本三维目标识别。然而,由于不切实际的预训练设置,这些方法在真实点云上的性能仍然不足。此外,这些方法由于依赖Transformer的注意力模块而带来高昂的推理成本。在本文中,我们为解决这些限制做出了两项贡献。首先,我们提出了遮挡感知的文本-图像-点云预训练方法,以缩小训练-测试领域的差距。从52K个合成三维对象中,我们的框架生成了近630K个部分点云用于预训练,持续提升了现有流行三维网络在真实场景中的识别性能。其次,为降低计算需求,我们引入了DuoMamba,一种专为点云设计的双流线性状态空间模型。通过将两条空间填充曲线与一维卷积相结合,DuoMamba有效地建模了点标记之间的空间依赖关系,为Transformer提供了强大的替代方案。当使用我们的框架进行预训练时,DuoMamba超越了当前最先进的方法,同时降低了延迟和浮点运算次数,突显了我们方法在真实应用中的潜力。我们的代码和数据可在https://ndkhanh360.github.io/project-occtip获取。
引用
@article{arxiv.2502.10674,
title = {Occlusion-aware Text-Image-Point Cloud Pretraining for Open-World 3D Object Recognition},
author = {Khanh Nguyen and Ghulam Mubashar Hassan and Ajmal Mian},
journal= {arXiv preprint arXiv:2502.10674},
year = {2025}
}
备注
Accepted to CVPR 2025