中文

ARMANI:面向统一跨模态时尚设计的部件级服饰-文本对齐

计算机视觉与模式识别 2022-08-12 v1

摘要

跨模态时尚图像合成因融合多模态的巨大潜力和广泛的时尚图像应用,已成为生成领域中最具前景的方向之一。为实现精准生成,跨模态合成方法通常依赖对比语言-图像预训练(Contrastive Language-Image Pre-training, CLIP)来对齐文本与服饰信息。本文认为,仅对齐纹理与服饰信息不足以捕捉视觉信息的语义,因此提出 MaskCLIP。MaskCLIP 将服饰分解为语义部件,确保视觉与文本信息之间细粒度且语义准确的对齐。基于 MaskCLIP,我们提出 ARMANI,一种具有部件级服饰-文本对齐的统一跨模态时尚设计模型。ARMANI 在第一阶段基于学习到的跨模态码本将图像离散为均匀 token,在第二阶段使用 Transformer 在给定控制信号 token 的条件下对真实图像的图像 token 分布进行建模。与同样依赖两阶段范式的先前方法不同,ARMANI 将文本 token 引入码本,使模型能够利用细粒度语义信息生成更逼真的图像。此外,通过引入跨模态 Transformer,ARMANI 具有通用性,可完成来自多种控制信号的图像合成,如纯文本、草图图像和部分图像。在我们新收集的跨模态时尚数据集上进行的大量实验表明,ARMANI 在多种合成任务中生成照片级真实图像,并优于现有的最先进(state-of-the-art, SOTA)跨模态图像合成方法。我们的代码见 https://github.com/Harvey594/ARMANI。

关键词

引用

@article{arxiv.2208.05621,
  title  = {ARMANI: Part-level Garment-Text Alignment for Unified Cross-Modal Fashion Design},
  author = {Xujie Zhang and Yu Sha and Michael C. Kampffmeyer and Zhenyu Xie and Zequn Jie and Chengwen Huang and Jianqing Peng and Xiaodan Liang},
  journal= {arXiv preprint arXiv:2208.05621},
  year   = {2022}
}

备注

Accepted by ACMMM22