MGT:扩展虚拟试穿至多件服装场景
计算机视觉与模式识别
2025-06-04 v2
摘要
计算机视觉正在通过虚拟试穿(VTON)和虚拟试穿-off(VTOFF)变革时尚行业。VTON使用目标照片和标准化服装图片生成指定服装下人物的图像,而更具挑战性的变体——人到人虚拟试穿(p2p-VTON)——使用另一人穿着该服装的照片。VTOFF则从穿衣者照片中提取标准化服装图片。我们引入Multi-Garment TryOffDiff(MGT),一种能够处理多种服装类型的基于扩散的VTOFF模型,包括上装、下装和连衣裙。MGT基于潜在扩散架构,采用SigLIP-based图像条件编码捕获服装的形状、纹理和图案特征。为解决服装多样性问题,MGT采用类别特定嵌入,在VITON-HD和DressCode上实现最先进的VTOFF结果。配合VTON模型使用时,MGT进一步提升p2p-VTON效果,通过减少不必要的属性传递(如肤色),确保保留人物特性。演示、代码和模型已公开:https://rizavelioglu.github.io/tryoffdiff/。
引用
@article{arxiv.2504.13077,
title = {Effective Dual-Region Augmentation for Reduced Reliance on Large Amounts of Labeled Data},
author = {Prasanna Reddy Pulakurthi and Majid Rabbani and Celso M. de Melo and Sohail A. Dianat and Raghuveer M. Rao},
journal= {arXiv preprint arXiv:2504.13077},
year = {2025}
}
备注
9 pages, 2 figures, 4 tables, Accepted to SPIE DSC 2025 Conference: Synthetic Data for Artificial Intelligence and Machine Learning: Tools, Techniques, and Applications III