CrossVTON: guided by Tri-zone Priors 的跨类别虚拟试穿推理
计算机视觉与模式识别
2025-02-21 v1
摘要
尽管图像基虚拟试穿系统取得了显著进展,但生成跨类别虚拟试穿的真实且稳健的拟合图像仍是一个具有挑战性的任务。主要困难源于缺乏类人推理能力,即在处理服装与模特之间的尺寸不匹配的同时识别并利用模型图像中不同区域的独特功能。在解决此问题方面,我们 drew inspiration from human cognitive processes,并将复杂的跨类别试穿推理分解为一个结构化框架。该框架系统性地将模型图像分解为三个 distinct 区域:试穿区、重建区和想象区。每个区域在容纳服装和促进真实合成方面发挥特定作用。在为跨类别场景赋予稳健的推理能力方面,我们提出了一种迭代数据构造函数。该构造函数涵盖了包括内类别试穿、any-to-dress 转换(将任何服装类别替换为连衣裙)以及 dress-to-any 转换(将连衣裙替换为另一服装类别)在内的多种情形。利用生成的数据集,我们引入了 tri-zone priors generator,通过分析输入服装如何与模型图像对齐来智能预测试穿、重建和想象区。在这些 tri-zone priors 的指导下,我们提出的方法CrossVTON 在定性和定量评估中均优于现有基线。值得注意的是,它在处理跨类别虚拟试穿方面表现出色,满足了实际应用的复杂需求。
关键词
引用
@article{arxiv.2502.14373,
title = {CrossVTON: Mimicking the Logic Reasoning on Cross-category Virtual Try-on guided by Tri-zone Priors},
author = {Donghao Luo and Yujie Liang and Xu Peng and Xiaobin Hu and Boyuan Jiang and Chengming Xu and Taisong Jin and Chengjie Wang and Yanwei Fu},
journal= {arXiv preprint arXiv:2502.14373},
year = {2025}
}