通过动态姿态交互追求时间一致的视频虚拟试穿
计算机视觉与模式识别
2025-05-23 v1 多媒体
摘要
视频虚拟试穿旨在用特定服装无缝地为视频中的主体着装。主要挑战在于在动态适应主体的姿态和体型的同时保持服装的视觉真实性。虽然现有方法主要聚焦于基于图像的虚拟试穿,但将这些技术直接扩展到视频往往导致时间不一致。大多数当前的视频虚拟试穿方法通过引入时间模块来缓解这一挑战,但仍忽略了人体与服装之间关键的时空姿态交互。视频中的有效姿态交互不仅应考虑每帧中人体与服装姿态的空间对齐,还应考虑整个视频中人体姿态的时间动态。基于此动机,我们提出了一种新框架,即动态姿态交互扩散模型(DPIDM),利用扩散模型深入探索视频虚拟试穿中的动态姿态交互。技术上,DPIDM 引入了一种基于骨架的姿态适配器,将同步的人体和服装姿态整合到去噪网络中。随后精心设计了一个层次注意力模块,通过基于姿态感知的时空注意力机制来建模帧内人体-服装姿态交互以及跨帧的长期人体姿态动态。此外,DPIDM 利用连续帧之间的时间正则化注意力损失来增强时间一致性。在 VITON-HD、VVT 和 ViViD 数据集上进行的广泛实验证明了我们 DPIDM 相对于基线方法的优越性。特别地,DPIDM 在 VVT 数据集上取得了 0.506 的 VFID 分数,相比最先进的 GPD-VVTO 方法提升了 60.5%。
引用
@article{arxiv.2505.16980,
title = {Pursuing Temporal-Consistent Video Virtual Try-On via Dynamic Pose Interaction},
author = {Dong Li and Wenqi Zhong and Wei Yu and Yingwei Pan and Dingwen Zhang and Ting Yao and Junwei Han and Tao Mei},
journal= {arXiv preprint arXiv:2505.16980},
year = {2025}
}
备注
CVPR 2025