中文

让计数器数数:具有准确物体数量的文本到图像生成

计算机视觉与模式识别 2024-06-17 v1 人工智能 图形学

摘要

尽管文本到图像扩散模型取得了空前的成功,但使用文本控制 depicted 物体的数量仍然 surprisingly 困难。这在技术文档、儿童绘本或烹饪食谱插图等各种应用中都很重要。生成准确计数的物体在根本上具有挑战性,因为生成模型需要为每个物体实例保持独立身份意识,即使多个物体外观相同或重叠,然后在生成过程中进行全局计算。仍然不知道是否存在此类表示。为解决计数准确生成问题,我们首先识别扩散模型中可携带物体身份信息的特征。随后,我们利用它们在去噪过程中分离和计数物体实例,检测过生成和不足生成。我们通过训练一个预测现有物体布局下缺失物体形状和位置的模型来修正后者,并展示如何使用其进行正确物体计数的去噪引导。我们的做法称为 CountGen,不依赖于外部来源来确定物体布局,而是使用扩散模型本身的先验,创建与提示和随机种子相关的布局。我们在两个基准数据集上进行评估,发现 CountGen 在计数准确性方面显著优于现有基线。

关键词

引用

@article{arxiv.2406.10210,
  title  = {Make It Count: Text-to-Image Generation with an Accurate Number of Objects},
  author = {Lital Binyamin and Yoad Tewel and Hilit Segev and Eran Hirsch and Royi Rassin and Gal Chechik},
  journal= {arXiv preprint arXiv:2406.10210},
  year   = {2024}
}

备注

Project page is at https://make-it-count-paper.github.io/