中文

CityRefer:基于城市级点云数据的地理感知三维视觉定位数据集

计算机视觉与模式识别 2023-10-31 v1

摘要

城市级三维点云是一种展现细致复杂室外结构的有前景的方式。它囊括了分割后城市组件(包括汽车、街道与建筑)的外观与几何特征,可用于自动驾驶车辆与无人机用户交互式导航等引人注目的应用。然而,相较于图像与室内场景丰富的文本标注,室外场景文本标注的匮乏对这些应用的实现构成了重大挑战。为应对此问题,我们引入了用于城市级视觉定位的 CityRefer 数据集。该数据集包含 SensatUrban 城市场景中出现的 3D 物体的 35k 条自然语言描述,以及与 OpenStreetMap 同步的 5k 个地标标签。为确保数据集的质量与准确性,CityRefer 数据集中的所有描述与标签均经人工核验。我们还开发了一个基线系统,可学习编码的语言描述、3D 物体实例以及城市地标的地理信息,以在 CityRefer 数据集上执行视觉定位。据我们所知,CityRefer 数据集是用于定位特定 3D 物体的最大城市级视觉定位数据集。

关键词

引用

@article{arxiv.2310.18773,
  title  = {CityRefer: Geography-aware 3D Visual Grounding Dataset on City-scale Point Cloud Data},
  author = {Taiki Miyanishi and Fumiya Kitamori and Shuhei Kurita and Jungdae Lee and Motoaki Kawanabe and Nakamasa Inoue},
  journal= {arXiv preprint arXiv:2310.18773},
  year   = {2023}
}

备注

NeurIPS D&B 2023. The first two authors are equally contributed