WildVidFit:基于图像的受控扩散模型实现野外视频虚拟试穿
计算机视觉与模式识别
2024-07-16 v1
摘要
视频虚拟试穿旨在生成保持服装身份并适应源视频中人物姿态与体型的逼真序列。传统图像方法依赖变形与混合,难以处理复杂人体动作与遮挡,限制了其在视频试穿中的有效性。此外,视频模型需要大量高质量数据与巨大的计算资源。为解决此问题,我们重新概念化视频试穿,将其视为以服装描述与人体动作为条件生成视频的过程。我们的解决方案WildVidFit采用图像的受控扩散模型实现简洁的单阶段方法。该模型在特定服装与个体条件下训练,仅需静态图像而非视频。它利用包括视频掩码自编码器用于分段平滑性改进以及自监督模型用于潜在空间中相邻帧特征对齐的扩散引导。这种集成显著提升了模型保持时间一致性的能力,使其在图像框架内实现更有效的视频试穿。我们在VITON-HD与DressCode数据集上进行实验,并测试VVT与TikTok数据集,证明WildVidFit能够生成流畅而连贯的视频。项目网页为wildvidfit-project.github.io。
关键词
引用
@article{arxiv.2407.10625,
title = {WildVidFit: Video Virtual Try-On in the Wild via Image-Based Controlled Diffusion Models},
author = {Zijian He and Peixin Chen and Guangrun Wang and Guanbin Li and Philip H. S. Torr and Liang Lin},
journal= {arXiv preprint arXiv:2407.10625},
year = {2024}
}