零样态虚拟试穿的掩码扩展注意力方法
计算机视觉与模式识别
2024-06-24 v1 图形学
机器学习
摘要
虚拟试穿(VTON)是高度活跃的研究领域,需求日益增长。旨在替换图像中某件服装,同时保持人物和服装特征以及图像保真度。当前文献采用监督式方法,限制了泛化能力并带来巨大的计算负担。本文提出了一种无需零样态训练的创新方法,用于参考图像中的服装填充。该方法利用扩散模型的先验,无需额外训练,充分利用其固有的泛化能力。方法采用扩展注意力机制,通过严格的掩码处理,将参考图像的信息传递到目标图像,克服了两个重大挑战:首先,通过深度特征对参考服装对目标人物进行初始位姿校正,缓解了"纹理黏附"问题;其次,利用带精心掩码的扩展注意力机制,消除参考背景的泄漏及其不必要影响。通过用户研究以及定性和定量比较,我们表明该方法在鲜见的服装或人物图像上,在图像质量和服装保持方面优于现有方法。
引用
@article{arxiv.2406.15331,
title = {Masked Extended Attention for Zero-Shot Virtual Try-On In The Wild},
author = {Nadav Orzech and Yotam Nitzan and Ulysse Mizrahi and Dov Danon and Amit H. Bermano},
journal= {arXiv preprint arXiv:2406.15331},
year = {2024}
}
备注
Project page available at https://nadavorzech.github.io/max4zero.github.io/