中文

MVImgNet2.0:更大规模的多视角图像数据集

计算机视觉与模式识别 2024-12-03 v1 人工智能 图形学

摘要

MVImgNet 是一个大规模数据集,包含约 22 万个真实世界物体的 238 类多视角图像。作为 ImageNet 的对应版本,它通过多视角拍摄引入 3D 视觉信号,形成 2D 与 3D 视觉之间的软桥梁。本文构建了扩展为约 52 万个物体和 515 个类别的 MVImgNet2.0 数据集,形成规模更大、更符合 2D 领域标准的 3D 数据集。除了数据集规模和类别范围的扩展,MVImgNet2.0 还具备四项新特性:(i) 大多数拍摄捕获物体的 360 度全景视角,可支持完整性学习的对象重建;(ii) 分割方式升级,生成更高精度的前景物体掩码;(iii) 采用更强大的结构-from-motion方法,为每帧图像估计更低的相机姿态误差;(iv) 通过先进方法重建更高质量的稠密点云,用于 360 度全景视角捕获的物体,可服务于下游应用。大量实验确认,MVImgNet2.0 在提升大型 3D 重建模型性能方面具有价值。MVImgNet2.0 将在 luyues.github.io/mvimgnet2 对外开放,包括所有 52 万个物体的多视角图像、重建的高质量点云以及数据标注代码,旨在激发更广泛的视觉社区。

关键词

引用

@article{arxiv.2412.01430,
  title  = {MVImgNet2.0: A Larger-scale Dataset of Multi-view Images},
  author = {Xiaoguang Han and Yushuang Wu and Luyue Shi and Haolin Liu and Hongjie Liao and Lingteng Qiu and Weihao Yuan and Xiaodong Gu and Zilong Dong and Shuguang Cui},
  journal= {arXiv preprint arXiv:2412.01430},
  year   = {2024}
}

备注

ACM Transactions on Graphics (TOG), SIGGRAPH Asia 2024