Efficient-3DiM:一日之内学习可泛化的单图像新视角合成器
计算机视觉与模式识别
2023-10-05 v1
摘要
新视角合成任务旨在从有限输入图像集生成物体或场景的未见视角。然而,从单幅图像合成新视角仍是计算机视觉领域的重大挑战。先前方法通过网格预测、多平面图像构建或更先进的技术如神经辐射场来解决此问题。近期,一个专为2D图像合成设计的预训练扩散模型已展现出在3D微调任务上充分优化后生成逼真新视角的能力。尽管保真度与泛化性大幅提升,训练如此强大的扩散模型需要海量训练数据与模型参数,导致训练时间极长且计算成本极高。为解决此问题,我们提出Efficient-3DiM,一个简单而有效的框架以学习单图像新视角合成器。受我们对扩散模型推理过程的深入分析启发,我们提出若干务实策略将训练开销降至可管理规模,包括精心设计的 timestep 采样策略、更优的3D特征提取器以及增强的训练方案。组合后,我们的框架能将总训练时间从10天减至少于1天,在相同计算平台(含8块Nvidia A100 GPU的一个实例)下显著加速训练过程。我们进行了全面实验以证明所提方法的效率与泛化性。
引用
@article{arxiv.2310.03015,
title = {Efficient-3DiM: Learning a Generalizable Single-image Novel-view Synthesizer in One Day},
author = {Yifan Jiang and Hao Tang and Jen-Hao Rick Chang and Liangchen Song and Zhangyang Wang and Liangliang Cao},
journal= {arXiv preprint arXiv:2310.03015},
year = {2023}
}