基于稀疏点对齐的无掩模视频虚拟试穿方法——PEMF-VTO
计算机视觉与模式识别
2025-07-22 v5 人工智能
摘要
视频虚拟试穿旨在在保持视觉保真度和时间连贯性的同时,将参考服装无缝传输到目标人物上。现有方法通常依赖用于定义试穿区域的掩膜,使其能够针对简单场景(如商店视频)实现准确的服装传输。然而,这些基于掩模的方法在复杂的真实场景中难以胜任,由于掩模过大且不一致,往往会破坏空间-时间信息,导致结果失真。无掩模方法虽然缓解了此问题,但在动态身体运动的视频中,准确定位试穿区域仍面临挑战。为此,我们提出了一种新的基于稀疏点对齐的无掩模视频虚拟试穿框架——PEMF-VTO,利用点增强指导实现服装传输。我们的核心创新点在于引入点增强指导,既能对空间层面的服装传输提供灵活可靠的控制,又能增强时间层面的视频连贯性。具体而言,我们设计了点增强变换器(PET),包含两个核心组件:点增强空间注意力(PSA),利用帧-服装点对齐精确引导服装传输;点增强时间注意力(PTA),利用帧-帧点对应关系增强时间连贯性,确保视频在不同帧之间的平滑过渡。大量实验表明,PEMF-VTO 在生成更自然、更连贯且视觉效果更佳的试穿视频方面优于当前最先进的方法,尤其在复杂野外场景中表现突出。论文主页链接为 https://pemf-vto.github.io/。
引用
@article{arxiv.2412.03021,
title = {PEMF-VTO: Point-Enhanced Video Virtual Try-on via Mask-free Paradigm},
author = {Tianyu Chang and Xiaohao Chen and Zhichao Wei and Xuanpu Zhang and Qing-Guo Chen and Weihua Luo and Peipei Song and Xun Yang},
journal= {arXiv preprint arXiv:2412.03021},
year = {2025}
}