中文

一次即足:基于轻量级 DiT 的视频虚拟试穿通过一次性服装外观注入

计算机视觉与模式识别 2025-10-10 v1

摘要

视频虚拟试穿旨在替换视频中人物的服装为目标服装。当前基于 U-Net 的双分支架构在扩散模型中取得了显著成功,但将其适用于基于扩散 Transformer 的模型仍具有挑战性。初始引入服装参考分支的潜在空间特征需要添加或修改 backbone 网络,从而导致大量可训练参数。随后,服装的潜在空间特征缺乏内在的时间特性,因而需要额外的学习。为解决这些挑战,我们提出了一种新方法,OIE(Once is Enough),一种基于首帧服装替换的虚拟试穿策略:具体而言,我们采用基于图像的服装迁移模型替换初始帧的服装,然后在编辑后的首帧内容控制下,利用姿态和掩码信息指导视频生成模型的时间先验,对剩余帧进行顺序合成。实验表明,我们的方法在参数效率和计算效率方面均优于同时保持领先性能。

关键词

引用

@article{arxiv.2510.07654,
  title  = {Once Is Enough: Lightweight DiT-Based Video Virtual Try-On via One-Time Garment Appearance Injection},
  author = {Yanjie Pan and Qingdong He and Lidong Wang and Bo Peng and Mingmin Chi},
  journal= {arXiv preprint arXiv:2510.07654},
  year   = {2025}
}

备注

5 pages (including references), 4 figures. Code and models will be released upon publication