通过合成标题提高面部生成质量和提示跟随
计算机视觉与模式识别
2024-05-20 v1 机器学习
摘要
近期基于扩散模型的文本到图像生成技术显著提升了生成图像的质量,并扩展了对广泛对象表征的能力。然而,确保模型严格遵循文本提示仍是一个重大挑战。这一问题在试图生成逼真的人类照片时尤为突出。在缺乏显著提示工程的情况下,这些模型常常生成不真实的图像,通常无法充分利用提示中的全部信息。这一局限性主要归因于扩散模型训练中所使用的图像标题通常侧重于上下文信息,而非人物外观细节。在本文中,我们通过引入一种无需训练的管道,从人物图像中生成准确的外观描述。我们应用该方法为公开可用的面部数据集创建约25万条标题。随后,我们使用这些合成标题对文本到图像扩散模型进行微调。我们的结果表明,这一方法显著提高了模型生成高质量、真实人类面部的能力,并增强了对给定提示的遵循程度,优于基线模型。我们分享了合成标题、预训练的模型checkpoint以及训练代码。
引用
@article{arxiv.2405.10864,
title = {Improving face generation quality and prompt following with synthetic captions},
author = {Michail Tarasiou and Stylianos Moschoglou and Jiankang Deng and Stefanos Zafeiriou},
journal= {arXiv preprint arXiv:2405.10864},
year = {2024}
}