LOTS:基于素描-文本配对的多条件图像生成
计算机视觉与模式识别
2025-09-05 v2 人工智能
摘要
时装设计是一种融合视觉与文本表达的复杂创作过程。设计师通过素描传递想法,定义空间结构和设计元素;通过文本描述捕捉材料、纹理和风格细节。本文提出了LOTS(LOcalized Text and Sketch for fashion image generation),一种基于素描-文本条件的完整时装外观生成方法。LOTS利用全局描述性信息,结合配对的局部素描与文本信息进行条件控制,引入一种基于步骤的融合策略以适配扩散模型。首先,模块化的双峰中心表示编码素描和文本,进入共享潜在空间,同时保留独立的局部特征;随后,扩散对齐阶段通过注意力机制在扩散模型的多步去噪过程中整合局部与全局条件。为验证方法有效性,我们基于Fashionpedia构建了Sketchy数据集——首个提供每个图像多个文本-素描配对的时装数据集。定量结果表明,LOTS在全局与局部指标上均实现了图像生成的SOTA性能;定性示例及人类评估研究凸显其前所未有的设计定制化水平。
引用
@article{arxiv.2507.22627,
title = {LOTS of Fashion! Multi-Conditioning for Image Generation via Sketch-Text Pairing},
author = {Federico Girella and Davide Talon and Ziyue Liu and Zanxi Ruan and Yiming Wang and Marco Cristani},
journal= {arXiv preprint arXiv:2507.22627},
year = {2025}
}
备注
Accepted at ICCV25 (Oral). Project page: https://intelligolabs.github.io/lots/