在文本到图像合成中学习生成语义布局以提升文本-图像一致性
计算机视觉与模式识别
2023-08-17 v1
摘要
现有文本到图像生成方法在真实感与文本-图像一致性上已树立高标准,这很大程度上受益于规模可达50亿对的网络级文本-图像数据集。然而,在特定领域数据集(如城市场景、医学图像和人脸)上训练的文本到图像生成模型,因缺乏文本-图像对仍受制于低文本-图像一致性。此外,为特定领域收集数十亿文本-图像对耗时且昂贵。因此,在不依赖网络级文本-图像数据集的情况下确保高文本-图像一致性仍具挑战。本文提出一种利用可用语义布局增强文本-图像一致性的新方法。具体而言,我们提出一种高斯-类别扩散过程,同时生成图像及对应的布局对。实验表明,通过训练模型为每个像素生成语义标签,可引导文本到图像生成模型感知不同图像区域的语义。我们证明,在文本-图像对稀缺的Multi-Modal CelebA-HQ与Cityscapes数据集上,相较现有文本到图像生成方法,我们的方法实现了更高的文本-图像一致性。代码见https://pmh9960.github.io/research/GCDP。
引用
@article{arxiv.2308.08157,
title = {Learning to Generate Semantic Layouts for Higher Text-Image Correspondence in Text-to-Image Synthesis},
author = {Minho Park and Jooyeol Yun and Seunghwan Choi and Jaegul Choo},
journal= {arXiv preprint arXiv:2308.08157},
year = {2023}
}
备注
Accepted to ICCV 2023