中文

Re-Imagen:检索增强的文本到图像生成器

计算机视觉与模式识别 2022-11-23 v3 人工智能 机器学习

摘要

文本到图像生成的研究在生成多样且照片级真实图像方面取得了显著进展,这由在大规模图像-文本数据上训练的扩散与自回归模型所驱动。尽管最先进的模型能够生成常见实体的高质量图像,它们往往在生成不常见实体(如“Chortai(狗)”或“Picarones(食物)”)的图像时存在困难。为解决此问题,我们提出检索增强的文本到图像生成器(Re-Imagen),一种利用检索信息生成高保真且忠实图像的生成模型,即便对于稀有或未见过的实体也是如此。给定文本提示,Re-Imagen 访问外部多模态知识库以检索相关的(图像,文本)对,并将其用作生成图像的参考。借助该检索步骤,Re-Imagen 被增强了所提及实体的高层语义与低层视觉细节知识,从而提升其生成实体视觉外观的准确性。我们在包含(图像,文本,检索)三元组的构建数据集上训练 Re-Imagen,以教导模型同时基于文本提示与检索进行 grounding。此外,我们开发了一种新的采样策略,交错使用针对文本与检索条件的无分类器引导,以平衡文本与检索对齐。Re-Imagen 在 COCO 与 WikiImage 上的 FID 分数取得显著增益。为进一步评估模型能力,我们引入 EntityDrawBench,一个新基准,评估涵盖狗、食物、地标、鸟与角色等多物体类别中从频繁到稀有的多样实体的图像生成。在 EntityDrawBench 上的人类评估表明,Re-Imagen 能显著提升生成图像的保真度,尤其对于较低频的实体。

关键词

引用

@article{arxiv.2209.14491,
  title  = {Re-Imagen: Retrieval-Augmented Text-to-Image Generator},
  author = {Wenhu Chen and Hexiang Hu and Chitwan Saharia and William W. Cohen},
  journal= {arXiv preprint arXiv:2209.14491},
  year   = {2022}
}

备注

9 pages