中文

Quark:实时、高分辨率的通用神经视图合成

计算机视觉与模式识别 2024-11-26 v1 图形学 机器学习

摘要

我们提出了一种新型神经算法,用于实现高质量、高分辨率的实时新视图合成。从稀疏的RGB图像或视频流输入,我们的网络既重建3D场景,又在NVIDIA A100上以1080p分辨率实现30fps的新视图渲染。我们的前馈网络在广泛的数据集和场景上具有良好的泛化能力,为实时方法实现了最先进的质量。我们的质量接近,甚至在某些情况下超过了顶级离线方法的质量。为实现这些结果,我们使用了若干关键概念的新型组合方式,并将其整合为一种协同且有效的算法。我们基于表示场景的半透明层的前期工作,使用迭代学习的渲染-精炼方法来改进这些层。与平坦层不同,我们的方法重建分层深度图(LDMs),有效地表示具有复杂深度和遮挡的场景。迭代更新步骤嵌入到多尺度、UNet风格的架构中,以在降低分辨率上进行尽可能多的计算。在每个更新步骤内部,为更好地聚合来自多个输入视图的信息,我们使用了专用的Transformer-based网络组件。这允许大部分输入图像处理在输入图像空间内完成,而不是在层空间内完成,从而进一步提高了效率。最后,由于我们重建和渲染的实时性质,我们为每一帧动态创建和丢弃内部3D几何体,为每个视图生成LDM。综合而言,这产生了一种新型且有效的视图合成算法。通过广泛的评估,我们展示我们实现了实时速度下的领先质量。项目页面:https://quark-3d.github.io/

关键词

引用

@article{arxiv.2411.16680,
  title  = {Quark: Real-time, High-resolution, and General Neural View Synthesis},
  author = {John Flynn and Michael Broxton and Lukas Murmann and Lucy Chai and Matthew DuVall and Clément Godard and Kathryn Heal and Srinivas Kaza and Stephen Lombardi and Xuan Luo and Supreeth Achar and Kira Prabhu and Tiancheng Sun and Lynn Tsai and Ryan Overbeck},
  journal= {arXiv preprint arXiv:2411.16680},
  year   = {2024}
}

备注

SIGGRAPH Asia 2024 camera ready version; project page https://quark-3d.github.io/