中文

基于扩散 Transformer 的 VITON-DiT:从人类舞蹈视频中实现野外视频试穿

计算机视觉与模式识别 2024-06-10 v2

摘要

视频试穿作为一个拥有巨大实际应用潜力的领域。先前的工作局限于将产品服装图像传递到姿势简单、背景单一的人类视频上,在面对随意拍摄的视频时表现不佳。最近,Sora 展示了扩散 Transformer(DiT)在生成具有真实场景特征的逼真视频方面的可扩展性。鼓舞人心,我们提出首个基于 DiT 的视频试穿框架,用于实际野外应用,命名为 VITON-DiT。具体而言,VITON-DiT 包含一个服装提取器、一个空间-时间去噪 DiT,以及一个身份保留 ControlNet。为忠实恢复服装细节,将提取的服装特征与去噪 DiT 的自注意力输出以及 ControlNet 融合。我们还在训练期间引入了新颖的随机选择策略,并在推理阶段提出了插值自回归(IAR)技术,以促进长视频生成。不同于现有方法需要构建繁琐且受限的配对训练数据集的做法,VITON-DiT 通过仅依赖无配对的人类舞蹈视频和精心设计的多阶段训练策略来缓解这一限制。此外,我们策划了一个具有挑战性的基准数据集来评估 casual 视频试穿的性能。广泛的实验表明,VITON-DiT 在复杂人体姿态的野外视频中能够生成具有空间-时间一致性的试穿结果。

关键词

引用

@article{arxiv.2405.18326,
  title  = {VITON-DiT: Learning In-the-Wild Video Try-On from Human Dance Videos via Diffusion Transformers},
  author = {Jun Zheng and Fuwei Zhao and Youjiang Xu and Xin Dong and Xiaodan Liang},
  journal= {arXiv preprint arXiv:2405.18326},
  year   = {2024}
}

备注

Project Page: https://zhengjun-ai.github.io/viton-dit-page/