中文

MoniRefer:一个基于路侧基础设施的真实世界大规模多模态数据集,用于3D视觉定位

计算机视觉与模式识别 2026-01-01 v1

摘要

3D视觉定位旨在从3D点云场景中定位出与给定自然语言句子语义对应的目标。这对于路侧基础设施系统理解自然语言并在复杂交通环境中定位相关目标物体至关重要。然而,大多数现有的3D视觉定位数据集和方法都集中于室内和室外驾驶场景,由于缺乏由路侧基础设施传感器捕获的配对点云-文本数据,室外监控场景仍未得到探索。在本文中,我们引入了一项新任务:面向室外监控场景的3D视觉定位,该任务能够在自车视角之外实现基础设施级别的交通场景理解。为支持此任务,我们构建了MoniRefer,这是首个用于路侧级3D视觉定位的真实世界大规模多模态数据集。该数据集包含约136,018个物体和411,128条自然语言表达,采集自真实世界环境中的多个复杂交通路口。为确保数据集的质量和准确性,我们人工验证了所有语言描述和物体的3D标签。此外,我们还提出了一种新的端到端方法,名为Moni3DVG,该方法利用图像提供的丰富外观信息以及点云提供的几何和光学信息进行多模态特征学习和3D物体定位。在所提出的基准上的大量实验和消融研究证明了我们方法的优越性和有效性。我们的数据集和代码将予以发布。

关键词

引用

@article{arxiv.2512.24605,
  title  = {MoniRefer: A Real-world Large-scale Multi-modal Dataset based on Roadside Infrastructure for 3D Visual Grounding},
  author = {Panquan Yang and Junfei Huang and Zongzhangbao Yin and Yingsong Hu and Anni Xu and Xinyi Luo and Xueqi Sun and Hai Wu and Sheng Ao and Zhaoxing Zhu and Chenglu Wen and Cheng Wang},
  journal= {arXiv preprint arXiv:2512.24605},
  year   = {2026}
}

备注

14 pages