中文

图像生成模型在生成多组件图像方面的挑战

计算机视觉与模式识别 2023-11-27 v1

摘要

近期文本到图像生成器的进展带来了图像生成的强大能力。然而,提示词的复杂性成为生成图像质量的瓶颈。一个尤其未被充分探索的方面是生成模型在给定先验条件下创建包含多个组件的高质量图像的能力。在本文中,我们提出并验证了一种称为组件包含分数(Components Inclusion Score, CIS)的指标,用于评估模型正确生成多个组件的程度。我们的结果显示,被评估的模型难以将来自多组件提示词的所有视觉元素纳入(所有评估模型每个组件的 CIS 下降 8.53%)。我们还发现,随着组件数量增加,图像质量和图像内的上下文感知显著下降(Inception Score 下降 15.91%,Frechet Inception Distance 增加 9.62%)。为补救该问题,我们在自建的含多组件测试数据集上微调了 Stable Diffusion V2,优于其原始版本。总之,这些发现揭示了现有文本到图像生成器的一个关键局限,阐明了使用复杂提示词在单幅图像中生成多个组件的挑战。

关键词

引用

@article{arxiv.2311.13620,
  title  = {The Challenges of Image Generation Models in Generating Multi-Component Images},
  author = {Tham Yik Foong and Shashank Kotyan and Po Yuan Mao and Danilo Vasconcellos Vargas},
  journal= {arXiv preprint arXiv:2311.13620},
  year   = {2023}
}

备注

10 pages, 6 figures, and 3 tables