CityRefer:基于城市级点云数据的地理感知三维视觉定位数据集
计算机视觉与模式识别
2023-10-31 v1
摘要
城市级三维点云是一种展现细致复杂室外结构的有前景的方式。它囊括了分割后城市组件(包括汽车、街道与建筑)的外观与几何特征,可用于自动驾驶车辆与无人机用户交互式导航等引人注目的应用。然而,相较于图像与室内场景丰富的文本标注,室外场景文本标注的匮乏对这些应用的实现构成了重大挑战。为应对此问题,我们引入了用于城市级视觉定位的 CityRefer 数据集。该数据集包含 SensatUrban 城市场景中出现的 3D 物体的 35k 条自然语言描述,以及与 OpenStreetMap 同步的 5k 个地标标签。为确保数据集的质量与准确性,CityRefer 数据集中的所有描述与标签均经人工核验。我们还开发了一个基线系统,可学习编码的语言描述、3D 物体实例以及城市地标的地理信息,以在 CityRefer 数据集上执行视觉定位。据我们所知,CityRefer 数据集是用于定位特定 3D 物体的最大城市级视觉定位数据集。
引用
@article{arxiv.2310.18773,
title = {CityRefer: Geography-aware 3D Visual Grounding Dataset on City-scale Point Cloud Data},
author = {Taiki Miyanishi and Fumiya Kitamori and Shuhei Kurita and Jungdae Lee and Motoaki Kawanabe and Nakamasa Inoue},
journal= {arXiv preprint arXiv:2310.18773},
year = {2023}
}
备注
NeurIPS D&B 2023. The first two authors are equally contributed