中文

ViViD:基于扩散模型的视频虚拟试穿方法

计算机视觉与模式识别 2024-05-29 v2

摘要

视频虚拟试穿旨在将服装物品传递到目标人的视频上。直接以帧为单位应用图像-based试穿技术会导致时序不一致的结果,而之前的视频-based试穿方案只能生成低视觉质量和模糊的结果。本文中,我们提出了ViViD,一个新颖的框架,利用强大的扩散模型来解决视频虚拟试穿任务。具体而言,我们设计了服装编码器,以提取细粒度的服装语义特征,引导模型捕获服装细节并通过提出的注意力特征融合机制将其注入目标视频。为确保空间-时序一致性,我们引入轻量级姿态编码器,对姿态信号进行编码,使模型能够学习服装与人体姿态之间的相互作用,并在文本到图像稳定扩散模型中插入层次化时序模块,以实现更连贯、更逼真的视频合成。此外,我们收集了一个新数据集,是截至目前为止规模最大、服装类型最丰富、分辨率最高的数据集,用于视频虚拟试穿任务。广泛的实验表明,我们的方法能够生成令人满意的视频试穿结果。该数据集、代码和权重将公开可用。项目页面:https://becauseimbatman0.github.io/ViViD。

关键词

引用

@article{arxiv.2405.11794,
  title  = {ViViD: Video Virtual Try-on using Diffusion Models},
  author = {Zixun Fang and Wei Zhai and Aimin Su and Hongliang Song and Kai Zhu and Mao Wang and Yu Chen and Zhiheng Liu and Yang Cao and Zheng-Jun Zha},
  journal= {arXiv preprint arXiv:2405.11794},
  year   = {2024}
}