中文

逆向虚拟试穿:从着装人物生成多类别产品风格图像

计算机视觉与模式识别 2026-02-24 v2

摘要

虚拟试穿(VTON)已被广泛探索用于将服装渲染到人物图像上,而其逆任务——虚拟脱衣(VTOFF)——却在很大程度上被忽视。VTOFF 旨在直接从穿着服装的人物照片中恢复标准化的服装产品图像。这种能力对于电子商务平台、大规模数据集整理以及基础模型的训练具有重要的实用价值。与必须处理各种姿态和风格的 VTON 不同,VTOFF 自然受益于以平面服装图像形式呈现的一致输出格式。然而,现有方法面临两个主要限制:(i)仅依赖单张照片的视觉线索通常会导致歧义,以及(ii)生成的图像通常会出现精细细节丢失,限制了其在现实世界中的适用性。为了应对这些挑战,我们引入了 TEMU-VTOFF,一个用于 VTOFF 的文本增强多类别框架。我们的架构建立在双 DiT 主干之上,配备了多模态注意力机制,联合利用图像、文本和掩码信息来解决视觉歧义,并实现跨服装类别的稳健特征学习。为了显式缓解细节退化,我们进一步设计了一个对齐模块,用于细化服装结构和纹理,确保高质量的输出。在 VITON-HD 和 Dress Code 上的大量实验表明,TEMU-VTOFF 达到了新的最先进性能,显著提高了视觉真实感以及与目标服装的一致性。

关键词

引用

@article{arxiv.2505.21062,
  title  = {Inverse Virtual Try-On: Generating Multi-Category Product-Style Images from Clothed Individuals},
  author = {Davide Lobba and Fulvio Sanguigni and Bin Ren and Marcella Cornia and Rita Cucchiara and Nicu Sebe},
  journal= {arXiv preprint arXiv:2505.21062},
  year   = {2026}
}

备注

Accepted at ICLR 2026