中文

MagicTryOn:利用扩散 Transformer 实现保服饰的视频虚拟试穿

计算机视觉与模式识别 2025-09-30 v3

摘要

视频虚拟试穿(VVT)旨在合成在连续视频帧中显得自然的服装,捕捉其动态以及与人运动的交互。尽管近期取得了进展,现有的 VVT 方法仍然存在服装保真度不足和时空一致性有限的问题。原因在于:(1)对服装信息的利用不足,注入的服装线索有限,导致较弱的精细细节保真度;以及(2)缺乏时空建模,这阻碍了跨帧身份一致性,并导致时间抖动和外观漂移。在本文中,我们提出了 MagicTryOn,一个基于扩散 Transformer 的保服饰视频虚拟试穿框架。为了保留细粒度的服装细节,我们提出了一种细粒度服装保留策略,将服装线索解耦并将这些分解后的先验注入去噪过程中。为了提高时间上的服装一致性并抑制抖动,我们引入了服装感知的时空旋转位置嵌入(RoPE),它在全自注意力中扩展了 RoPE,使用时空相对位置来调制服装 token。我们在训练过程中进一步施加了掩码感知损失,以增强服装区域内的保真度。此外,我们采用分布匹配蒸馏将采样轨迹压缩为四步,在不降低服装保真度的情况下实现实时推理。大量定量和定性实验表明,MagicTryOn 优于现有方法,在无约束环境中提供了卓越的服装细节保真度和时间稳定性。

关键词

引用

@article{arxiv.2505.21325,
  title  = {MagicTryOn: Harnessing Diffusion Transformer for Garment-Preserving Video Virtual Try-on},
  author = {Guangyuan Li and Siming Zheng and Hao Zhang and Jinwei Chen and Junsheng Luan and Binkai Ou and Lei Zhao and Bo Li and Peng-Tao Jiang},
  journal= {arXiv preprint arXiv:2505.21325},
  year   = {2025}
}