FSViewFusion:新物体的少样本视角生成
计算机视觉与模式识别
2024-03-14 v2
摘要
自 NeRF 出现以来,新视角合成取得了巨大发展。然而,NeRF 模型会在单一场景上过拟合,缺乏对分布外物体的泛化能力。最近,扩散模型在为视角合成引入泛化性方面展现出了卓越的性能。受这些进展的启发,我们在没有显式 3D 先验的情况下,探索了预训练 stable diffusion 模型在视角合成中的能力。具体而言,鉴于 Dreambooth 具备仅需少量样本即可适应特定新物体的强大能力,我们的方法基于个性化文本到图像模型 Dreambooth。我们的研究揭示了两个有趣的发现。首先,我们观察到,与在大量多视图数据上微调扩散模型等可以说更复杂的策略相比,Dreambooth 能够学习视角的高层概念。其次,我们证实视角的概念可以被解耦,并迁移到一个新物体上,而不管学习视角时所基于的原始物体的身份。受此启发,我们引入了一种学习策略 FSViewFusion,该策略仅通过单一场景的一张图像样本继承特定视角,并使用低秩适配器将知识迁移到从少量样本中学习到的新物体上。通过大量实验,我们证明我们的方法尽管简单,但在为自然图像生成可靠视角样本方面非常高效。代码和模型将被发布。
关键词
引用
@article{arxiv.2403.06394,
title = {FSViewFusion: Few-Shots View Generation of Novel Objects},
author = {Rukhshanda Hussain and Hui Xian Grace Lim and Borchun Chen and Mubarak Shah and Ser Nam Lim},
journal= {arXiv preprint arXiv:2403.06394},
year = {2024}
}