中文

幽魂藏于细节之中:基于关键帧驱动细节注入提升视频虚拟试穿效果

计算机视觉与模式识别 2026-04-30 v3

摘要

尽管基于扩散转换器(DiT)的视频虚拟试穿(VVT)在合成逼真视频方面取得了显著进展,但现有方法仍难以捕获细粒度的服装动力学,以及在视频帧之间保持背景的完整性。它们还因引入额外交互模块而导致高计算成本,同时现有公开数据集的规模和质量有限,也限制了模型的泛化能力和有效训练。为此,我们提出了一种新框架KeyTailor,以及一个大规模高清数据集ViT-HD。KeyTailor的核心思想是关键帧驱动细节注入策略,这源于关键帧本身同时包含前景动力学和背景一致性。具体而言,KeyTailor采用指令导向的关键帧采样策略,从输入视频中筛选出信息丰富的帧。随后,采用两个量身定做的关键帧驱动模块——服装细节增强模块和协作背景优化模块——分别将服装动力学提炼为服装相关的潜在特征,并引导优化背景潜在特征的完整性。这些被丰富化的细节随姿态、掩码和噪声潜在特征一起注入标准DiT模块,从而实现高效且逼真的试穿视频合成。该设计在不显式修改DiT架构的前提下确保了一致性,同时避免了额外的复杂性。此外,我们的数据集ViT-HD包含15,070个高质量视频样本,分辨率为810×1080,涵盖多样化的服装。大量实验表明,KeyTailor在服装保真度和背景完整性方面,在动态和静态场景中均优于最先进的基线方法。

关键词

引用

@article{arxiv.2512.20340,
  title  = {The devil is in the details: Enhancing Video Virtual Try-On via Keyframe-Driven Details Injection},
  author = {Qingdong He and Xueqin Chen and Yanjie Pan and Peng Tang and Pengcheng Xu and Zhenye Gan and Chengjie Wang and Xiaobin Hu and Jiangning Zhang and Yabiao Wang},
  journal= {arXiv preprint arXiv:2512.20340},
  year   = {2026}
}

备注

Accepted by CVPR 2026 (Main Conference)