DL3DV-10K:用于基于深度学习的3D视觉的大规模场景数据集
计算机视觉与模式识别
2024-01-02 v2 人工智能
摘要
我们见证了基于深度学习的3D视觉的重大进展,从基于神经辐射场(NeRF)的3D表示学习到新视角合成(NVS)的应用。然而,现有的用于基于深度学习的3D视觉的场景级数据集,要么局限于合成环境,要么局限于少量真实世界场景,非常不足。这种不足不仅阻碍了对现有方法的全面基准测试,也限制了深度学习3D分析中可能探索的内容。为了解决这一关键差距,我们提出了DL3DV-10K,一个大规模场景数据集,包含来自10,510个视频的5120万帧,这些视频从65种兴趣点(POI)位置拍摄,涵盖有界和无界场景,具有不同程度的反射、透明度和光照。我们对DL3DV-10K上的最新NVS方法进行了全面基准测试,揭示了未来NVS研究的有价值见解。此外,我们在从DL3DV-10K学习可泛化NeRF的初步研究中获得了令人鼓舞的结果,这证明了大规模场景级数据集对于为学习3D表示奠定基础模型的必要性。我们的DL3DV-10K数据集、基准测试结果和模型将在https://dl3dv-10k.github.io/DL3DV-10K/上公开。
引用
@article{arxiv.2312.16256,
title = {DL3DV-10K: A Large-Scale Scene Dataset for Deep Learning-based 3D Vision},
author = {Lu Ling and Yichen Sheng and Zhi Tu and Wentian Zhao and Cheng Xin and Kun Wan and Lantao Yu and Qianyu Guo and Zixun Yu and Yawen Lu and Xuanmao Li and Xingpeng Sun and Rohan Ashok and Aniruddha Mukherjee and Hao Kang and Xiangrui Kong and Gang Hua and Tianyi Zhang and Bedrich Benes and Aniket Bera},
journal= {arXiv preprint arXiv:2312.16256},
year = {2024}
}