中文

ITA-MDT:面向图像基虚拟试穿的数字扩散变换器框架

计算机视觉与模式识别 2025-06-03 v2

摘要

本文提出 ITA-MDT(Image-Timestep-Adaptive Masked Diffusion Transformer Framework for Image-Based Virtual Try-On),旨在通过利用掩码扩散变换器(Masked Diffusion Transformer, MDT)增强对全局服装上下文与细粒细节的处理,克服现有方法的局限性。IVTON 任务涉及将一个图像中的服装无缝叠加到另一个图像中的人物上,生成其佩戴该服装的逼真图像。与依赖大型预训练 U-Net 架构的传统扩散式虚拟试穿模型不同,ITA-MDT 采用轻量级、可扩展的基于变换器的去噪扩散模型,配合掩码潜在建模方案,在保持竞争性能的同时降低计算开销。ITA-MDT 的关键组件是图像-时间自适应特征聚合器(Image-Timestep Adaptive Feature Aggregator, ITAFA),它根据扩散时间步和服装图像复杂度,动态地将来自图像编码器的所有特征融合为统一大小的特征表示,实现对特征权重的自适应分配,使模型能够在去噪阶段根据需求强调全局信息或细粒细节。此外,还提出显著区域提取器(Salient Region Extractor, SRE)模块,用于识别服装的复杂区域,提供高分辨率的局部信息作为全局服装图像信息的额外条件,从而在不必处理整个服装图像的情况下,增强对高显著性服装区域细节的保留。比较评估表明,ITA-MDT 在提高效率的同时保持了强大的性能,在多个指标上实现了最先进的结果。

关键词

引用

@article{arxiv.2503.20418,
  title  = {ITA-MDT: Image-Timestep-Adaptive Masked Diffusion Transformer Framework for Image-Based Virtual Try-On},
  author = {Ji Woo Hong and Tri Ton and Trung X. Pham and Gwanhyeong Koo and Sunjae Yoon and Chang D. Yoo},
  journal= {arXiv preprint arXiv:2503.20418},
  year   = {2025}
}

备注

CVPR 2025, Project Page: https://jiwoohong93.github.io/ita-mdt/