DreamVVT:通过分阶段 Diffusion Transformer 框架掌握真实场景下的逼真视频虚拟试穿
计算机视觉与模式识别
2025-08-06 v1
摘要
视频虚拟试穿(VVT)技术因其在电商广告和娱乐领域的广阔应用前景而备受学术界关注。然而,现有的多数端到端方法严重依赖稀缺的以服装为中心的成对数据集,且未能有效利用先进视觉模型的先验和测试时输入,这使得在无约束场景下准确保留细粒度服装细节和保持时间一致性面临挑战。为了应对这些挑战,我们提出了 DreamVVT,这是一个精心设计的、基于 Diffusion Transformer (DiT) 的两阶段框架,它能够利用多样化的非成对以人为中心的数据,从而增强在真实场景中的适应性。为了进一步利用来自预训练模型和测试时输入的先验知识,在第一阶段,我们从输入视频中采样代表性帧,并利用一个集成了视觉语言模型(VLM)的多帧试穿模型,合成高保真且语义一致的关键帧试穿图像。这些图像作为后续视频生成的补充外观指导。在第二阶段,从输入内容中提取骨架图以及细粒度的运动和外观描述,并将其连同关键帧试穿图像一起输入到通过 LoRA 适配器增强的预训练视频生成模型中。这确保了未见区域的长期时间连贯性,并实现了高度合理的动态运动。大量的定量和定性实验表明,DreamVVT 在真实场景下保留详细服装内容和时间稳定性方面超越了现有方法。我们的项目页面:https://virtu-lab.github.io/
引用
@article{arxiv.2508.02807,
title = {DreamVVT: Mastering Realistic Video Virtual Try-On in the Wild via a Stage-Wise Diffusion Transformer Framework},
author = {Tongchun Zuo and Zaiyu Huang and Shuliang Ning and Ente Lin and Chao Liang and Zerong Zheng and Jianwen Jiang and Yuan Zhang and Mingyuan Gao and Xin Dong},
journal= {arXiv preprint arXiv:2508.02807},
year = {2025}
}
备注
18 pages, 12 figures