中文

KITTI-360:用于城市场景二维与三维理解的新数据集与基准

计算机视觉与模式识别 2022-06-06 v2

摘要

过去几十年间,包括计算机视觉、图形学和机器人在内的人工智能若干主要子领域在很大程度上彼此独立发展。然而近来,学界意识到朝向鲁棒智能系统(如自动驾驶汽车)的进展需要不同领域间的协同努力。这促使我们开发了广受欢迎的 KITTI 数据集的继任者 KITTI-360。KITTI-360 是一个郊区驾驶数据集,包含更丰富的输入模态、全面的语义实例标注和准确的定位,以促进视觉、图形与机器人交叉领域的研究。为高效标注,我们创建了一个用包围基元标注 3D 场景的工具,并开发了一个将该信息迁移至 2D 图像域的模型,从而生成了超过 15 万张图像和 10 亿个 3D 点,且具有跨 2D 和 3D 一致的语义实例标注。此外,我们针对移动感知相关的若干任务建立了基准与基线,涵盖同一数据集上来自计算机视觉、图形学和机器人的问题,例如语义场景理解、新视角合成和语义 SLAM。KITTI-360 将推动这些研究领域交叉处的进展,从而有助于解决当今的重大挑战之一:全自主自动驾驶系统的开发。

关键词

引用

@article{arxiv.2109.13410,
  title  = {KITTI-360: A Novel Dataset and Benchmarks for Urban Scene Understanding in 2D and 3D},
  author = {Yiyi Liao and Jun Xie and Andreas Geiger},
  journal= {arXiv preprint arXiv:2109.13410},
  year   = {2022}
}

备注

arXiv admin note: text overlap with arXiv:1511.03240