中文

ChronoTailor:利用注意力引导实现视频虚拟试穿的精细化

计算机视觉与模式识别 2025-06-09 v1

摘要

视频虚拟试穿旨在无缝替换源视频中人物的服装。尽管该领域取得了显著进展,但现有方法仍在保持连续性和再现服装细节方面存在挑战。本文提出 ChronoTailor,一个基于扩散的框架,生成在保持精细服装细节的同时实现时序一致的视频。通过采用精确的时空注意力机制引导服装细节特征的融合,ChronoTailor 实现了稳健的试穿性能。首先,ChronoTailor 利用区域感知的空间引导来引导空间注意力的演化,并采用注意力驱动的时序特征融合机制以生成更连续的时序特征。这种双重方法不仅实现了精细的局部编辑,还有效缓解了视频动态导致的artifacts。其次,ChronoTailor 集成多尺度服装特征以保留低层视觉细节,并包含服装-姿态特征对齐以确保动态运动中的时序连续性。此外,我们收集了 StyleDress 数据集,包含复杂服装、多样环境和多样姿态,优于现有公开数据集,供研究公开使用。大量实验表明,ChronoTailor 在运动中保持时空连续性并保留服装细节,显著优于先前方法。

关键词

引用

@article{arxiv.2506.05858,
  title  = {ChronoTailor: Harnessing Attention Guidance for Fine-Grained Video Virtual Try-On},
  author = {Jinjuan Wang and Wenzhang Sun and Ming Li and Yun Zheng and Fanyao Li and Zhulin Tao and Donglin Di and Hao Li and Wei Chen and Xianglin Huang},
  journal= {arXiv preprint arXiv:2506.05858},
  year   = {2025}
}