基于类别条件的自奖励机制用于提升文本到图像模型性能
计算机视觉与模式识别
2024-05-28 v2 人工智能
摘要
自奖励技术近期在自然语言处理 (NLP) 领域迅速发展,成为一种强大的工具,使语言模型能够通过在训练期间提供自身奖励来生成高质量且相关的响应。本文构建于自奖励模型的概念之上,提出其在文本到图像生成式 AI 模型中的视觉等效方法。该方法通过对基于自生成自评判数据集进行微调来实现,使微调过程更加自动化且数据质量更佳。该提议机制利用了诸如基于词汇的对象检测、图像描述生成等预训练模型,并以用户可能需要改进生成数据质量的对象集合为条件进行建模。该方法已在稳定扩散模型上实现、微调并评估,性能提升幅度至少为 60%,显著优于现有的商业和研究文本到图像模型。此外,构建的自奖励机制实现了图像的完全自动生成,同时提升了生成图像的视觉质量,并更高效地遵循提示指令。本工作使用的代码已在 https://github.com/safouaneelg/SRT2I 上公开获取。
引用
@article{arxiv.2405.13473,
title = {Class-Conditional self-reward mechanism for improved Text-to-Image models},
author = {Safouane El Ghazouali and Arnaud Gucciardi and Umberto Michelucci},
journal= {arXiv preprint arXiv:2405.13473},
year = {2024}
}