中文

基于集合的文本到图像生成离线评估

计算机视觉与模式识别 2024-10-24 v1 信息检索

摘要

文本到图像 (TTI) 系统常在人们进行构思时提供帮助,即创作过程中早期阶段,面对广泛的相关图像集有助于探索设计空间。由于构思是TTI任务的一个重要子类,理解如何根据TTI系统支持构思的能力对其进行量化评估,对于促进这些用户的研究与开发至关重要。然而,现有的TTI评估指标仍侧重于类似于F\'renche Inception Distance (FID) 的分布相似性指标。我们采取另一种方法,基于排序评估中的既定方法,发展出TTI评估指标,以显式模型化用户如何浏览和与 spatially排列的图像集进行交互。我们提出的TTI离线评估指标不仅捕捉生成图像与用户构思需求相关性,还考虑生成图像集的多样性和排列方式。我们使用人类研究对我们提出的TTI指标族进行分析,分析对象为来自三个不同TTI系统生成的图像网格,这些系统基于广泛使用的基准(如MS-COCO标题和Localized Narratives)的子集,以及在自然环境中使用的提示。我们的结果表明,将指标 grounded于人们如何使用系统是重要且未充分研究的基准设计领域。

关键词

引用

@article{arxiv.2410.17331,
  title  = {Offline Evaluation of Set-Based Text-to-Image Generation},
  author = {Negar Arabzadeh and Fernando Diaz and Junfeng He},
  journal= {arXiv preprint arXiv:2410.17331},
  year   = {2024}
}