中文

ITVTON:基于集成图像和文本的虚拟试穿扩散转换器

计算机视觉与模式识别 2025-10-22 v3

摘要

虚拟试穿旨在将衣物无缝贴合到人物图像上,近期已取得显著进展。然而,现有方法常依赖重复使用的网络结构或额外的图像编码器来提取衣物特征,这会增加计算开销和网络复杂度。本文提出ITVTON,一个高效框架,利用扩散转换器(DiT)作为单一生成器以提高图像保真度。通过在宽度维度上拼接衣物和人物图像,并纳入两者的文本描述,ITVTON有效捕获衣物-人物互动,同时保持真实感。为进一步降低计算成本,我们限制训练于单个扩散转换器(Single-DiT)块内的注意力参数。广泛的实验表明,ITVTON在定性和定量分析上均优于基线方法,为虚拟试穿设定了新标准。此外,来自IGPair的10,257对图像的实验确认了其在真实场景中的鲁棒性。

关键词

引用

@article{arxiv.2501.16757,
  title  = {ITVTON: Virtual Try-On Diffusion Transformer Based on Integrated Image and Text},
  author = {Haifeng Ni and Ming Xu},
  journal= {arXiv preprint arXiv:2501.16757},
  year   = {2025}
}

备注

Accepted by PRCV 2025