Hypersim:面向整体室内场景理解的真实感合成数据集
计算机视觉与模式识别
2021-08-19 v5 图形学
摘要
对于许多基础的场景理解任务,从真实图像中获取逐像素的地面真值标签是困难甚至不可能的。我们通过引入 Hypersim——一个面向整体室内场景理解的真实感合成数据集——来解决这一挑战。为创建该数据集,我们利用由专业艺术家制作的大型合成场景库,生成了 461 个室内场景的 77,400 张图像,并附有详细的逐像素标签及相应的地面真值几何信息。我们的数据集:(1) 仅依赖公开可用的 3D 资产;(2) 包含每个场景完整的场景几何、材质信息和光照信息;(3) 包含每张图像密集的逐像素语义实例分割以及完整的相机信息;(4) 将每张图像分解为漫反射率、漫反射光照以及一个捕捉视角相关光照效应的非漫反射残差项。我们在场景、物体和像素层面分析了我们的数据集,并从资金、计算时间和标注工作量方面分析了成本。值得注意的是,我们发现从头生成整个数据集的成本大约仅为训练一个流行的开源自然语言处理模型的一半。我们还在两项真实世界场景理解任务——语义分割和 3D 形状预测——上评估了仿真到真实的迁移性能,发现基于我们的数据集进行预训练可显著提升两项任务的表现,并在最具挑战性的 Pix3D 测试集上取得了最先进的性能。我们所有渲染的图像数据,以及用于生成数据集和开展实验的全部代码,均在线公开可用。
引用
@article{arxiv.2011.02523,
title = {Hypersim: A Photorealistic Synthetic Dataset for Holistic Indoor Scene Understanding},
author = {Mike Roberts and Jason Ramapuram and Anurag Ranjan and Atulit Kumar and Miguel Angel Bautista and Nathan Paczan and Russ Webb and Joshua M. Susskind},
journal= {arXiv preprint arXiv:2011.02523},
year = {2021}
}
备注
Accepted for publication at the International Conference on Computer Vision (ICCV) 2021