GarmentAligner: 通过检索增强的多级校正实现文本到服装生成
计算机视觉与模式识别
2024-08-26 v2
摘要
通用的文本到图像模型为艺术、设计和媒体领域带来了革命性的创新。然而,当应用于服装生成时,即使是最先进的文本到图像模型也会遭受细粒度语义错位的问题,特别是在服装部件的数量、位置和相互关系方面。针对这一点,我们提出了GarmentAligner,一个通过检索增强的多级校正训练的文本到服装扩散模型。为了实现部件级别的语义对齐,我们引入了一个自动部件提取流程,从对应的图像和标题中获取服装部件的空间和数量信息。随后,为了利用服装图像内部的部件关系,我们通过基于部件级相似度排序的检索增强为每件服装构建检索子集,并进行对比学习,以增强模型从正负样本中对部件的感知。为了进一步增强在语义、空间和数量粒度上的部件对齐,我们提出利用多级校正损失,该损失利用了详细的部件信息。实验结果表明,与现有竞争对手相比,GarmentAligner实现了更优的保真度和细粒度语义对齐。
引用
@article{arxiv.2408.12352,
title = {GarmentAligner: Text-to-Garment Generation via Retrieval-augmented Multi-level Corrections},
author = {Shiyue Zhang and Zheng Chong and Xujie Zhang and Hanhui Li and Yuhao Cheng and Yiqiang Yan and Xiaodan Liang},
journal= {arXiv preprint arXiv:2408.12352},
year = {2024}
}
备注
Accepted by ECCV 2024