中文

ScanNet:室内场景的丰富标注三维重建

计算机视觉与模式识别 2017-04-12 v2

摘要

利用监督深度学习方法的一个关键要求是可获得大规模带标签数据集。不幸的是,在 RGB-D 场景理解领域,可用数据极少——当前数据集覆盖的场景视角范围小且语义标注有限。为解决此问题,我们引入了 ScanNet,一个包含 1513 个场景中 250 万视图的 RGB-D 视频数据集,标注有 3D 相机位姿、表面重建和语义分割。为收集此数据,我们设计了一个易用且可扩展的 RGB-D 采集系统,包括自动化表面重建和众包语义标注。我们展示使用该数据有助于在多项 3D 场景理解任务上取得最先进性能,包括 3D 物体分类、语义体素标注和 CAD 模型检索。该数据集可在 http://www.scan-net.org 免费获取。

关键词

引用

@article{arxiv.1702.04405,
  title  = {ScanNet: Richly-annotated 3D Reconstructions of Indoor Scenes},
  author = {Angela Dai and Angel X. Chang and Manolis Savva and Maciej Halber and Thomas Funkhouser and Matthias Nießner},
  journal= {arXiv preprint arXiv:1702.04405},
  year   = {2017}
}