中文

Dynamic Try-On:用动态注意力机制驾驭视频虚拟试穿

计算机视觉与模式识别 2025-07-29 v2

摘要

视频试穿因其巨大的现实应用潜力而成为一个前景广阔的研究领域。此前关于视频试穿的研究主要关注将产品服装图像转移到具有简单人体姿态的视频中,而在处理复杂运动时表现不佳。为了更好地保留服装细节,这些方法配备了额外的服装编码器,导致更高的计算资源消耗。该领域的主要挑战有两个:(1)在视频试穿中利用服装编码器的能力同时降低计算需求;(2)确保人体各部位合成的时序一致性,尤其是在快速运动期间。为解决这些问题,我们提出了一种基于扩散Transformer(DiT)的新型视频试穿框架,命名为Dynamic Try-On。为了降低计算开销,我们采用了一种简单的方法,即利用DiT骨干网络本身作为服装编码器,并采用动态特征融合模块来存储和整合服装特征。为确保人体各部位的时序一致性,我们引入了一种肢体感知的动态注意力模块,在去噪过程中强制DiT骨干网络关注人体肢体区域。大量实验证明了Dynamic Try-On在生成稳定平滑的试穿结果方面的优越性,即使对于包含复杂人体姿态的视频也是如此。

关键词

引用

@article{arxiv.2412.09822,
  title  = {Dynamic Try-On: Taming Video Virtual Try-on with Dynamic Attention Mechanism},
  author = {Jun Zheng and Jing Wang and Fuwei Zhao and Xujie Zhang and Xiaodan Liang},
  journal= {arXiv preprint arXiv:2412.09822},
  year   = {2025}
}

备注

Project Page: https://zhengjun-ai.github.io/dynamic-tryon-page/. Accepted by The 36th British Machine Vision Conference