中文

稀疏输入视角合成:3D表示与可靠先验

计算机视觉与模式识别 2024-11-25 v1

摘要

新视角合成是指在给定少数视角图像的情况下,合成场景新视角的问题。这是计算机视觉与图形学中的一个基础问题,并支持大量应用,如元宇宙、事件的自由视角观看、电子游戏、视频稳定与视频压缩。近期诸如辐射场和多平面图像等3D表示显著提升了从新视角渲染图像的质量。然而,这些模型需要密集采样输入视角以实现高质量渲染。当仅有少量输入视角可用时,其性能会显著下降。在本论文中,我们聚焦于静态与动态场景的稀疏输入新视角合成问题。在第一部分工作中,我们主要聚焦于使用神经辐射场进行静态场景的稀疏输入新视角合成。我们研究了可靠且密集先验的设计,以便在此类情况下更好地对NeRF进行正则化。具体而言,我们提出了一对输入视角中像素可见性的先验。我们表明,这种与物体相对深度相关的可见性先验,比现有的绝对深度先验更密集且更可靠。我们使用平面扫描体计算可见性先验,而无需在大型数据集上训练神经网络。我们在多个数据集上评估了我们的方法,并表明我们的模型在稀疏输入新视角合成方面优于现有方法。在第二部分中,我们旨在通过学习不受泛化问题影响的特定场景先验来进一步改进正则化。我们通过仅在给定场景上学习先验而不在大型数据集上进行预训练来实现这一点。具体而言,我们设计了增强NeRF,以便为主要NeRF在场景的特定区域提供更好的深度监督。此外,我们将该框架扩展至TensoRF和ZipNeRF等更新、更快的辐射场模型。通过在多个数据集上的大量实验,我们展示了我们的方法在稀疏输入新视角合成中的优越性。稀疏输入快速动态辐射场的设计受到缺乏合适表示和可靠运动先验的严重制约。我们通过设计基于分解体积的显式运动模型来解决第一个挑战,该模型紧凑且优化速度快。我们还引入了可靠的稀疏流先验来约束运动场,因为我们发现广泛使用的密集光流先验是不可靠的。我们在多个数据集上展示了我们的运动表示和可靠先验的优势。在本论文的最后一部分,我们研究了视角合成在电子游戏帧率上采样中的应用。具体而言,我们考虑了时序视角合成问题,其目标是在给定过去帧和相机运动的情况下预测未来帧。这里的关键挑战是通过估计物体过去的运动并对其进行外推来预测其未来运动。我们探索了使用多平面图像表示和场景深度来可靠地估计物体运动,特别是在遮挡区域。我们设计了一个新数据库以有效评估我们的动态场景时序视角合成方法,并表明我们实现了SOTA性能。

关键词

引用

@article{arxiv.2411.13631,
  title  = {Sparse Input View Synthesis: 3D Representations and Reliable Priors},
  author = {Nagabhushan Somraj},
  journal= {arXiv preprint arXiv:2411.13631},
  year   = {2024}
}

备注

PhD Thesis of Nagabhushan S N, Dept of ECE, Indian Institute of Science (IISc); Advisor: Dr. Rajiv Soundararajan; Thesis Reviewers: Dr. Kaushik Mitra (IIT Madras), Dr. Aniket Bera (Purdue University); Submitted: May 2024; Accepted and Defended: Sep 2024; Abstract condensed, please check the PDF for full abstract