若初未成,再试不妨:基于扩散模型通过筛选实现忠实文本到图像生成
计算机视觉与模式识别
2023-05-23 v1
摘要
尽管能力令人印象深刻,基于扩散的文本到图像(T2I)模型可能缺乏对文本提示的忠实性,生成的图像可能未包含所提及的所有对象、属性或关系。为缓解这些问题,近期工作提出了事后方法来改进模型忠实性而无需昂贵的重训练,通过修改模型利用输入提示的方式。本工作中,我们退一步表明,大型 T2I 扩散模型比通常设想的更为忠实,能够生成即便复杂提示也忠实的图片,而无需操纵生成过程。基于此,我们展示忠实性如何可简单地视为候选选择问题,并引入一个直接的流程:为文本提示生成候选图像,并根据可利用已有 T2I 评估指标的自动评分系统挑选最佳者。在多样基准上的定量比较与用户研究表明,相较事后增强方法,忠实性得到持续改善,且计算成本相当或更低。代码见 \url{https://github.com/ExplainableML/ImageSelect}。
引用
@article{arxiv.2305.13308,
title = {If at First You Don't Succeed, Try, Try Again: Faithful Diffusion-based Text-to-Image Generation by Selection},
author = {Shyamgopal Karthik and Karsten Roth and Massimiliano Mancini and Zeynep Akata},
journal= {arXiv preprint arXiv:2305.13308},
year = {2023}
}