中文

点云-文本匹配:基准数据集与基线

计算机视觉与模式识别 2025-06-04 v3 人工智能

摘要

本文提出并研究了一个新的实例级检索任务:点云-文本匹配(PTM),旨在识别与给定点云查询或文本查询相匹配的精确跨模态实例。PTM 在多种场景中具有潜在应用,例如室内/城市峡谷定位和场景检索。然而,实践中缺乏适用于 PTM 的针对性数据集。为解决这一问题,我们提出了一个新的 PTM 基准数据集,即 SceneDepict-3D2T。我们观察到,由于数据的固有特性(如点云的稀疏性、噪声或无序性,以及文本的歧义性、模糊性或不完整性),现有跨模态匹配方法在 PTM 中失效。为克服这些挑战,我们提出了一种 PTM 基线,命名为鲁棒点云-文本匹配方法(RoMa)。RoMa 包含两个关键模块:双重注意力感知模块(DAP)和鲁棒负样本对比学习模块(RNCL)。具体而言,DAP 利用 token 级和特征级注意力机制自适应地聚焦于有用的局部和全局特征,并将其聚合为共同表示,从而减少噪声和歧义的不利影响。为处理噪声对应关系,RNCL 通过将负样本对划分为干净子集和噪声子集,并分别赋予正向和反向优化方向,增强了抵御错误匹配的鲁棒性。我们在基准上进行了大量实验,证明了 RoMa 的优越性。

关键词

引用

@article{arxiv.2403.19386,
  title  = {PointCloud-Text Matching: Benchmark Datasets and a Baseline},
  author = {Yanglin Feng and Yang Qin and Dezhong Peng and Hongyuan Zhu and Xi Peng and Peng Hu},
  journal= {arXiv preprint arXiv:2403.19386},
  year   = {2025}
}

备注

The version submitted this time has been significantly revised and improved on the previous version