中文

CMHANet:用于点云配准的跨模态混合注意力网络

计算机视觉与模式识别 2026-03-16 v1 人工智能

摘要

鲁棒的点云配准是 3D 计算机视觉和几何深度学习中的基础任务,对于大规模 3D 重建、增强现实和场景理解等应用至关重要。然而,既定的基于学习的方法在面对数据不完整、传感器噪声和重叠区域不足等复杂现实场景时往往性能下降。为此,我们提出了 CMHANet,一种新的跨模态混合注意力网络。我们的方法将来自 2D 图像的丰富上下文信息与 3D 点云的几何细节相融合,构建全面且具鲁棒性的特征表示。此外,我们引入一种基于对比学习的创新优化函数,以强制几何一致性,显著提高模型对噪声和部分观察的鲁棒性。我们在 3DMatch 和具有挑战性的 3DLoMatch 数据集上评估了 CMHANet。\rev{此外,对 TUM RGB-D SLAM 数据集上的零样本评估验证了模型对未见域的泛化能力。}实验结果表明,我们的方法在配准准确性和整体鲁棒性方面均实现了显著的改进,超越了当前技术。我们也在 https://github.com/DongXu-Zhang/CMHANet 上发布了代码。

关键词

引用

@article{arxiv.2603.12721,
  title  = {CMHANet: A Cross-Modal Hybrid Attention Network for Point Cloud Registration},
  author = {Dongxu Zhang and Yingsen Wang and Yiding Sun and Haoran Xu and Peilin Fan and Jihua Zhu},
  journal= {arXiv preprint arXiv:2603.12721},
  year   = {2026}
}