中文

DreamSync:利用图像理解反馈对齐文本到图像生成

计算机视觉与模式识别 2023-12-01 v1 人工智能 计算与语言

摘要

尽管取得了广泛成功,文本到图像模型(T2I)仍难以生成既美观又忠实于用户输入文本的图像。我们提出DreamSync,一种按设计模型无关的的训练算法,可改进T2I模型以忠实于文本输入。DreamSync建立在TIFA评估框架近期的一个洞察之上——大型视觉-语言模型(VLM)能有效识别生成图像与文本输入之间的细粒度差异。DreamSync利用该洞察在无需任何标注数据的情况下训练T2I模型;它使用自身的生成结果来改进T2I模型。首先,它提示模型为给定输入文本生成若干候选图像。然后,它使用两个VLM来挑选最佳生成结果:一个视觉问答模型衡量生成图像与文本的对齐程度,另一个衡量生成的美学质量。筛选后,我们使用LoRA迭代微调T2I模型,将其生成导向所选的最佳生成结果。DreamSync不需要任何额外人工标注、模型架构改动或强化学习。尽管简单,DreamSync提升了两个基于扩散的T2I模型的语义对齐与美学吸引力,多个基准(TIFA上+1.7%、DSG1K上+2.9%、VILA美学上+3.4%)和人工评估均证实了这一点。

关键词

引用

@article{arxiv.2311.17946,
  title  = {DreamSync: Aligning Text-to-Image Generation with Image Understanding Feedback},
  author = {Jiao Sun and Deqing Fu and Yushi Hu and Su Wang and Royi Rassin and Da-Cheng Juan and Dana Alon and Charles Herrmann and Sjoerd van Steenkiste and Ranjay Krishna and Cyrus Rashtchian},
  journal= {arXiv preprint arXiv:2311.17946},
  year   = {2023}
}