中文

FVGen:基于对抗视频扩散蒸馏加速新视角合成

计算机视觉与模式识别 2025-08-11 v1

摘要

近期的3D重建进展使人们能够从稠密图像捕获中获得逼真的3D模型,但稀疏视角仍然是一个挑战,常导致不可见区域出现伪影。近期研究利用视频扩散模型(VDMs)生成密集观察,以在仅有稀疏视角时进行3D重建任务。但这些方法在使用VDMs时采样速度较慢。本文提出FVGen,一种新框架,通过将多步骤去噪教师模型蒸馏为少步骤去噪学生模型(使用生成对抗网络GAN和软化的逆KL散度最小化),实现了使用VDMs进行快速新视角合成,仅需四个采样步骤。在真实数据集上进行大量实验表明,与前述工作相比,FVGen在生成相同数量的新视角时,视觉质量相当或更好,同时将采样时间缩短超过90%。FVGen显著提高了下游重建任务的时间效率,尤其是在输入视角稀疏(超过2个)时,预训练VDM需要多次运行才能获得更好的空间覆盖。

关键词

引用

@article{arxiv.2508.06392,
  title  = {FVGen: Accelerating Novel-View Synthesis with Adversarial Video Diffusion Distillation},
  author = {Wenbin Teng and Gonglin Chen and Haiwei Chen and Yajie Zhao},
  journal= {arXiv preprint arXiv:2508.06392},
  year   = {2025}
}