中文

通过组合局部文本和草图实现多级条件化用于时尚图像生成

计算机视觉与模式识别 2026-02-23 v1

摘要

草图为设计师提供了一种简洁而富有表现力的早期时尚构思媒介,通过指定结构、轮廓和空间关系。而文本描述则补充草图,以传递材料、颜色和风格细节。有效地组合文本和视觉模式需要在利用文本中局部属性指导时遵循草图的视觉结构。我们提出LOcalized Text and Sketch with multi-level guidance (LOTS),一个增强时尚图像生成的框架,通过组合全局草图指导和多个局部草图-文本对。LOTS采用多级条件化阶段独立编码局部特征于共享潜在空间,同时保持全局结构协调。随后,扩散对指导阶段将局部与全局条件化通过注意力机制集成于扩散模型的多步去噪过程中。为验证我们的方法,我们开发了Sketchy——第一个提供多文本-草图对的时尚数据集。Sketchy提供高质量、干净的草图,呈现专业外观和一致结构。为评估超出此设置的鲁棒性,我们还包括一个"在野外"划分,包含非专业草图,具有更高的变异性和瑕疵。实验表明,我们的方法在强化全局结构依从性的同时,利用更丰富的局部语义指导,实现了超越当前最佳方法的改进。该数据集、平台和代码均公开可用。

关键词

引用

@article{arxiv.2602.18309,
  title  = {Multi-Level Conditioning by Pairing Localized Text and Sketch for Fashion Image Generation},
  author = {Ziyue Liu and Davide Talon and Federico Girella and Zanxi Ruan and Mattia Mondo and Loris Bazzani and Yiming Wang and Marco Cristani},
  journal= {arXiv preprint arXiv:2602.18309},
  year   = {2026}
}

备注

Project page: https://intelligolabs.github.io/lots/