中文

训练先验预测文本到图像模型性能

计算机视觉与模式识别 2023-10-26 v2 人工智能 计算与语言

摘要

文本到图像模型常能生成某些关系,如“宇航员骑骑马”,却无法生成由相同基本部分构成的另一关系,如“马骑宇航员”。这些失败常被视为模型依赖训练先验而非组合式构建新图像的证据。本文在stable diffusion 2.1文本到图像模型上检验该直觉。通过考察这些提示背后的主谓宾(SVO)三元组(如“宇航员”“骑”“马”),我们发现SVO三元组在训练数据中出现的频率越高,模型生成与该三元组对齐图像的能力越强。此处“对齐”指各词项以正确相互关系出现在生成图像中。令人惊讶的是,该频率升高也削弱了模型生成与翻转三元组对齐图像的能力。例如,若“宇航员骑马”在训练数据中频繁出现,则“马骑宇航员”的图像往往对齐较差。因此,我们的结果表明当前模型偏向于生成训练中所见关系的图像,并为持续争论——这些文本到图像模型是否以传统意义运用抽象组合结构,抑或是在训练数据中显见关系间插值——提供了新数据。

关键词

引用

@article{arxiv.2306.01755,
  title  = {Training Priors Predict Text-To-Image Model Performance},
  author = {Charles Lovering and Ellie Pavlick},
  journal= {arXiv preprint arXiv:2306.01755},
  year   = {2023}
}