中文

StyleT2I:面向组合性与高保真度的文本到图像合成

计算机视觉与模式识别 2022-03-30 v1

摘要

尽管文本到图像合成已取得进展,先前方法难以泛化到输入文本中未见或代表性不足的属性组合。缺乏组合性可能对鲁棒性和公平性产生严重影响,例如无法合成代表性不足人口群体的面部图像。本文引入一个新框架StyleT2I,以改进文本到图像合成的组合性。具体而言,我们提出一个CLIP引导的对比损失,以更好区分不同句子间不同的组合。为进一步提升组合性,我们设计了一种新颖的语义匹配损失与空间约束,用于识别属性在预期空间区域操作下的潜在方向,从而得到更好的属性解耦潜在表示。基于识别出的属性潜在方向,我们提出组合属性调整以调整潜在码,从而实现更好的图像合成组合性。此外,我们利用识别出的潜在方向的2\ell_2范数正则化(范数惩罚)在图像-文本对齐与图像保真度间取得良好平衡。实验中,我们设计了一种新的数据集划分与评估指标来评价文本到图像合成模型的组合性。结果显示StyleT2I在输入文本与合成图像的一致性上优于先前方法,并实现了更高保真度。

关键词

引用

@article{arxiv.2203.15799,
  title  = {StyleT2I: Toward Compositional and High-Fidelity Text-to-Image Synthesis},
  author = {Zhiheng Li and Martin Renqiang Min and Kai Li and Chenliang Xu},
  journal= {arXiv preprint arXiv:2203.15799},
  year   = {2022}
}

备注

CVPR 2022