中文

以属性为中心的组合文本到图像生成

计算机视觉与模式识别 2023-01-05 v1

摘要

尽管近期文本到图像生成取得了令人瞩目的突破,生成模型难以捕捉欠表示属性组合的数据分布,同时过度记忆过度表示的属性组合,这引发了公众对其鲁棒性与公平性的担忧。为应对此挑战,我们提出ACTIG,一种以属性为中心的组合文本到图像生成框架。我们提出以属性为中心的特征增强与一种新颖的无图像训练方案,极大提升了模型生成具有欠表示属性图像的能力。我们进一步提出以属性为中心的对比损失,以避免对过度表示属性组合的过拟合。我们在CelebA-HQ与CUB数据集上验证我们的框架。大量实验表明ACTIG的组合泛化能力出色,且我们的框架在图像质量与文本-图像一致性方面优于先前工作。

关键词

引用

@article{arxiv.2301.01413,
  title  = {Attribute-Centric Compositional Text-to-Image Generation},
  author = {Yuren Cong and Martin Renqiang Min and Li Erran Li and Bodo Rosenhahn and Michael Ying Yang},
  journal= {arXiv preprint arXiv:2301.01413},
  year   = {2023}
}