中文

EscherNet:一种用于可扩展视图合成的生成模型

计算机视觉与模式识别 2024-03-20 v2

摘要

我们介绍了EscherNet,一种用于视图合成的多视图条件扩散模型。EscherNet学习隐式和生成式3D表示,并结合专门的相机位置编码,允许在任意数量的参考视图和目标视图之间对相机变换进行精确且连续的相对控制。EscherNet在视图合成方面表现出卓越的通用性、灵活性和可扩展性——它可以在单个消费级GPU上同时生成超过100个一致的目标视图,尽管训练时仅使用固定数量的3个参考视图到3个目标视图。因此,EscherNet不仅解决了零样本新视图合成问题,而且自然地统一了单图像和多图像3D重建,将这些不同的任务整合到一个统一的框架中。我们的大量实验表明,即使在针对每个单独问题专门定制的方法中,EscherNet在多个基准测试中也达到了最先进的性能。这种卓越的多功能性为设计用于3D视觉的可扩展神经架构开辟了新的方向。项目页面:https://kxhit.github.io/EscherNet。

关键词

引用

@article{arxiv.2402.03908,
  title  = {EscherNet: A Generative Model for Scalable View Synthesis},
  author = {Xin Kong and Shikun Liu and Xiaoyang Lyu and Marwan Taher and Xiaojuan Qi and Andrew J. Davison},
  journal= {arXiv preprint arXiv:2402.03908},
  year   = {2024}
}

备注

CVPR2024 Project Page: https://kxhit.github.io/EscherNet