基于条件扩散Transformer的视频虚拟试穿
计算机视觉与模式识别
2025-06-27 v1
摘要
视频虚拟试穿旨在在连续视频帧中自然地将衣物贴合到目标人物身上。这是一个具有挑战性的任务:一方面,输出视频需要保持良好的空间-时间一致性,另一方面,给定衣物的细节在所有帧中都需要得到很好地保留。直接逐帧使用基于图像的试穿方法会得到差差的效果 due to严重的不一致性。最近的基于扩散的视频试穿方法,虽然数量极少,却与类似的解决方案相吻合:将时间注意力插入基于图像的试穿模型,以适应视频试穿任务,这些方法显示出了改进,但仍存在不一致性问题。在本文中,我们提出了ViTI(Video Try-on Inpainter),将视频虚拟试穿表述为条件视频填充任务,这与以前的方法不同。如此一来,我们从视频生成问题而非基于图像的试穿问题开始,这从一开始就具有更好的空间-时间一致性。具体而言,我们首先构建了一个基于扩散Transformer的视频填充框架,采用完全3D空间-时间注意力,然后逐步将其适用于视频衣物填充,包括一系列掩码策略和多阶段训练。经过这些步骤,该模型可以根据提示在掩码处的衣物区域中生成适当的衣物像素,同时保持良好的空间-时间一致性。最后,与其他试穿方法一样,在模型中添加衣物条件,以确保填充的衣物外观和细节如预期。定量和定性实验结果均表明,ViTI优于以往工作。
引用
@article{arxiv.2506.21270,
title = {Video Virtual Try-on with Conditional Diffusion Transformer Inpainter},
author = {Cheng Zou and Senlin Cheng and Bolei Xu and Dandan Zheng and Xiaobo Li and Jingdong Chen and Ming Yang},
journal= {arXiv preprint arXiv:2506.21270},
year = {2025}
}
备注
10 pages, 6 figures