中文

MultiDiff: Consistent Novel View Synthesis from a Single Image

计算机视觉与模式识别 2024-06-27 v1

摘要

我们提出了MultiDiff,这是一种用于从单个RGB图像进行一致性新视角合成的新方法。单参考图像合成新视角的任务本质上是高度不确定的,因为存在对未观察区域的多种合理解释。为解决此问题,我们采用单目深度预测器和视频扩散模型等强先验条件。单目深度使我们能够对目标视角的扭曲参考图像进行条件控制,从而提高几何稳定性。视频扩散先验为模型提供了3D场景的强代理,使模型能够学习连续且像素级的跨生成图像对应关系。与依赖自回归图像生成且易受漂移和误差积累的方法不同,MultiDiff联合合成一系列帧,产生高质量且多视角一致的结果——即使在大相机运动的长期场景生成中也能实现,而推理时间缩短了一个数量级。为获得更好的一致性和图像质量,我们引入了一种新型的结构化噪声分布。我们的实验结果表明,MultiDiff在具有挑战性的真实世界数据集RealEstate10K和ScanNet上超越了最先进的方法。最后,我们的模型天然支持多视角一致的编辑,无需进一步调优。

关键词

引用

@article{arxiv.2406.18524,
  title  = {MultiDiff: Consistent Novel View Synthesis from a Single Image},
  author = {Norman Müller and Katja Schwarz and Barbara Roessle and Lorenzo Porzi and Samuel Rota Bulò and Matthias Nießner and Peter Kontschieder},
  journal= {arXiv preprint arXiv:2406.18524},
  year   = {2024}
}

备注

Project page: https://sirwyver.github.io/MultiDiff Video: https://youtu.be/zBC4z4qXW_4 - CVPR 2024