中文

Vanast:通过合成三元组监督实现人形图像动画的虚拟试穿

计算机视觉与模式识别 2026-05-05 v2

摘要

我们提出 Vanast,一个统一框架,可从单个人类图像、服装图像和姿态引导视频直接生成服装迁移后的人类动画视频。传统的两阶段管道将图像基于虚拟试穿和基于姿态的动画视为独立的过程,往往导致身份漂移、服装变形和前后不一致。我们的模型通过在单个统一步骤中完成整个过程以实现连贯的合成。为支持此设置,我们构建了大规模的三元组监督数据。我们的数据生成管道包括生成在不同于服装目录图像的替代服装中保持身份的图像、捕捉上装和下装的完整服装三元组以克服单件服装姿势视频对的限制,以及组装多样化的野生态三元组而无需服装目录图像。我们进一步引入了双模块架构用于视频扩散变换器,以稳定训练、保留预训练的生成质量,并提高服装精度、姿态一致性和身份保持效果,同时支持零样本服装插值。通过这些贡献,Vanast 能够在广泛的服装类型范围内产生高保真、身份一致的动画。

关键词

引用

@article{arxiv.2604.04934,
  title  = {Vanast: Virtual Try-On with Human Image Animation via Synthetic Triplet Supervision},
  author = {Hyunsoo Cha and Wonjung Woo and Byungjun Kim and Hanbyul Joo},
  journal= {arXiv preprint arXiv:2604.04934},
  year   = {2026}
}

备注

Accepted to CVPR 2026 Highlight, Project Page: https://hyunsoocha.github.io/vanast/