中文

MGT:扩展虚拟试穿至多件服饰情景

计算机视觉与模式识别 2025-07-14 v2 人工智能

摘要

计算机视觉正通过虚拟试穿(VTON)和虚拟试脱(VTOFF)改变时尚行业。VTON 利用目标照片和标准服饰图像生成指定服饰下人物的图像,而更具挑战性的变体人到人虚拟试穿(p2p-VTON)则使用另一位穿着该服饰的人的照片。VTOFF 则从穿着服饰的个人照片中提取标准服饰图像。我们引入 Multi-Garment TryOffDiff(MGT),一种能够处理多种服饰类型的基于扩散的 VTOFF 模型,包括上装、下装和连衣裙。MGT 基于潜在扩散架构,采用 SigLIP 图像条件来捕获服饰特征,如形状、纹理和图案。为解决服饰多样性问题,MGT 包含类别特定嵌入,在 VITON-HD 和 DressCode 上实现了最先进的 VTOFF 结果和具竞争力的性能。当与 VTON 模型配合使用时,进一步减少了不必要的属性转移,如肤色,从而确保保留人物特性。演示、代码和模型均可在:https://rizavelioglu.github.io/tryoffdiff/ 获取。

关键词

引用

@article{arxiv.2504.13078,
  title  = {MGT: Extending Virtual Try-Off to Multi-Garment Scenarios},
  author = {Riza Velioglu and Petra Bevandic and Robin Chan and Barbara Hammer},
  journal= {arXiv preprint arXiv:2504.13078},
  year   = {2025}
}

备注

Accepted at ICCVW'25