用于图像到点云配准的自监督跨模态学习
计算机视觉与模式识别
2025-09-22 v1 人工智能
摘要
弥合 2D 和 3D 传感器模态对于自主系统中的稳健感知至关重要。然而,由于纹理丰富但深度模糊的图像与稀疏但度量精确的点云之间的语义-几何鸿沟,以及现有方法收敛到局部最优的趋势,图像到点云(I2P)配准仍然具有挑战性。为了克服这些限制,我们引入了 CrossI2P,这是一个在单个端到端流程中统一跨模态学习和两阶段配准的自监督框架。首先,我们通过双路径对比学习学习几何-语义融合嵌入空间,实现 2D 纹理和 3D 结构的无标注双向对齐。其次,我们采用由粗到细的配准范式:全局阶段通过联合模态内上下文和跨模态交互建模建立超点-超像素对应关系,随后进行几何约束的点级细化以实现精确配准。第三,我们采用带有梯度归一化的动态训练机制来平衡特征对齐、对应细化和位姿估计的损失。大量实验表明,CrossI2P 在 KITTI Odometry 基准上比现有最先进方法高出 23.7%,在 nuScenes 上高出 37.9%,显著提高了准确性和鲁棒性。
引用
@article{arxiv.2509.15882,
title = {Self-Supervised Cross-Modal Learning for Image-to-Point Cloud Registration},
author = {Xingmei Wang and Xiaoyu Hu and Chengkai Huang and Ziyan Zeng and Guohao Nie and Quan Z. Sheng and Lina Yao},
journal= {arXiv preprint arXiv:2509.15882},
year = {2025}
}