Fashion-VDM:用于虚拟试衣的视频扩散模型
计算机视觉与模式识别
2024-11-05 v2
摘要
我们提出了Fashion-VDM,一个用于生成虚拟试衣视频的视频扩散模型(VDM)。给定一张输入的服装图像和一段人物视频,我们的方法旨在生成一段人物穿着给定服装的高质量试衣视频,同时保留人物的身份和动作。基于图像的虚拟试衣已展现出令人印象深刻的结果;然而,现有的视频虚拟试衣(VVT)方法在服装细节和时间一致性方面仍有不足。为了解决这些问题,我们提出了一种用于视频虚拟试衣的基于扩散的架构、一种用于增强对条件输入控制的分割无分类器引导方法,以及一种用于单次生成64帧、512像素视频的渐进式时间训练策略。我们还证明了联合图像-视频训练对于视频试衣的有效性,尤其是在视频数据有限的情况下。我们的定性和定量实验表明,我们的方法为视频虚拟试衣设立了新的最先进水平。更多结果,请访问我们的项目页面:https://johannakarras.github.io/Fashion-VDM。
引用
@article{arxiv.2411.00225,
title = {Fashion-VDM: Video Diffusion Model for Virtual Try-On},
author = {Johanna Karras and Yingwei Li and Nan Liu and Luyang Zhu and Innfarn Yoo and Andreas Lugmayr and Chris Lee and Ira Kemelmacher-Shlizerman},
journal= {arXiv preprint arXiv:2411.00225},
year = {2024}
}
备注
Accepted to SIGGRAPH Asia 2024