中文

DINOReg:基于视觉基础模型的强点云配准

计算机视觉与模式识别 2025-09-30 v1

摘要

点云配准是三维计算机视觉中的基础任务。大多数现有方法仅依赖几何信息进行特征提取与匹配。最近,一些研究已将RGB-D数据中的颜色信息纳入特征提取。尽管这些方法取得了显著的改进,但它们并未充分利用图像中丰富的纹理和语义信息,且特征融合以图像有损的方式进行,这限制了它们的性能。在本文中,我们提出DINOReg,一个充分利用视觉信息和几何信息来解决点云配准问题的配准网络。受视觉基础模型进展的启发,我们采用DINOv2从图像中提取信息丰富的视觉特征,并在块级别融合视觉特征与几何特征。该设计有效地将结合了DINOv2提取的丰富纹理和全局语义信息与几何骨干网络捕获的详细几何结构信息。此外,我们提出了一种混合位置编码来编码来自图像空间和点云空间的位置信息,从而增强了模型感知块之间空间关系的能力。在RGBD-3DMatch和RGBD-3DLoMatch数据集上的大量实验表明,我们的方法在几何专用和多模态配准方法上取得了显著改进,块内点率提高了14.2%,配准召回率提高了15.7%。代码公开获取于 https://github.com/ccjccjccj/DINOReg。

关键词

引用

@article{arxiv.2509.24370,
  title  = {DINOReg: Strong Point Cloud Registration with Vision Foundation Model},
  author = {Congjia Chen and Yufu Qu},
  journal= {arXiv preprint arXiv:2509.24370},
  year   = {2025}
}