中文

CatV2TON:用于基于视觉的虚拟试穿时序拼接的扩散变换器

计算机视觉与模式识别 2025-01-22 v1 人工智能

摘要

虚拟试穿(VTON)技术因其潜力通过实现对图像和视频的逼真衣物可视化而受到关注。然而,大多数现有方法在图像和视频试穿任务上难以实现高质量结果,尤其是在长视频场景中。本文我们引入CatV2TON,一种简单有效的基于视觉的虚拟试穿(V2TON)方法,支持单一扩散变换器模型的图像和视频试穿任务。通过对 garment和 person输入进行时序拼接并在图像和视频数据集混合训练,CatV2TON在静态和动态设置下实现了稳健的试穿性能。为高效长视频生成,我们提出一种重叠片段基于推理策略,使用顺序帧引导和自适应片段规范化(AdaCN)以减少资源需求维持时序一致性。我们还提出了ViViD-S,一种通过过滤背面帧并应用3D掩码平滑获得的精炼视频试穿数据集,以实现增强的时序一致性。全面实验表明,CatV2TON在图像和视频试穿任务中均优于现有方法,提供了一种通用可靠的解决方案,可实现多种情景下逼真的虚拟试穿。

关键词

引用

@article{arxiv.2501.11325,
  title  = {CatV2TON: Taming Diffusion Transformers for Vision-Based Virtual Try-On with Temporal Concatenation},
  author = {Zheng Chong and Wenqing Zhang and Shiyue Zhang and Jun Zheng and Xiao Dong and Haoxiang Li and Yiling Wu and Dongmei Jiang and Xiaodan Liang},
  journal= {arXiv preprint arXiv:2501.11325},
  year   = {2025}
}

备注

11 pages, 8 figures, 5 tables