中文

基于空间语义引导的交互式视频虚拟试穿iTryOn

计算机视觉与模式识别 2026-05-21 v1

摘要

视频虚拟试穿(VVT)旨在在人物视频中无缝替换衣物。虽然现有方法在保持时序一致性方面取得了显著进展,但主要局限于非交互式场景,其中模型仅展示衣物。这种限制忽略了真实服装呈现中至关重要的方面:主动的人类-服装交互。为弥合这一差距,我们提出并形式化了一种新颖的具有挑战性的任务:交互式视频虚拟试穿(Interactive VVT),其中视频中的主体主动与其服装交互。该任务在纯粹纹理保持之外引入了独特挑战,包括:(1)从标准姿态信息消除交互的语义歧义,以及:(2)从视频中学习复杂的服装变形,其中交互时刻稀少且短暂。为解决这些挑战,我们提出iTryOn,一种基于大规模视频扩散Transformer的新型框架。iTryOn pioneered 一种多级交互注入机制,以引导复杂动态的生成。在空间层面,我们引入一种无服装的3D手先验,提供精细的引导,以实现精确的手-服装接触,有效解决空间歧义。在语义层面,iTryOn利用全局描述实现整体语境,并利用带时间戳的行动描述实现局部交互,通过我们新近提出的面向行动的旋转位置编码(A-RoPE)进行同步。广泛的实验表明,iTryOn不仅在传统VVT基准上实现了最先进的性能,还在新的交互设置中建立了统治性的领先优势,标志着更动态和可控的虚拟试穿体验的重要一步。

关键词

引用

@article{arxiv.2605.21431,
  title  = {iTryOn: Mastering Interactive Video Virtual Try-On with Spatial-Semantic Guidance},
  author = {Jun Zheng and Zhengze Xu and Mengting Chen and Jing Wang and Jinsong Lan and Xiaoyong Zhu and Kaifu Zhang and Bo Zheng and Xiaodan Liang},
  journal= {arXiv preprint arXiv:2605.21431},
  year   = {2026}
}

备注

Project Page: https://zhengjun-ai.github.io/itryon-page. Accepted by ICML 2026