中文

为何不止一个?文本到图像集生成与评估

计算机视觉与模式识别 2025-09-26 v2 人工智能

摘要

尽管文本到图像模型取得了显著进展,但许多实际应用需要生成具有多样一致性要求的图像集。现有的一致方法往往专注于特定领域的特定一致性方面,这显著限制了其针对更广泛应用的泛化能力。本文提出了更具挑战性的问题,即文本到图像集(T2IS)生成,旨在生成满足用户指令中各种一致性要求的图像集。为系统性地研究此问题,我们首先引入了包含596个多样化指令的T2IS-Bench,覆盖26个子类别,为T2IS生成提供了全面的覆盖。基于此,我们提出了T2IS-Eval评估框架,将用户指令转化为多层次评估标准,并运用有效的评估器对生成的图像集与评估标准之间的一致性实现情况进行自适应评估。随后,我们提出了AutoT2IS,一种无需训练的框架,充分利用预训练Diffusion Transformer的in-context能力,来和谐化视觉元素,以满足图像级提示对齐和集级视觉一致性。对T2IS-Bench上的大规模实验表明,现有方法在多样化一致性挑战中均表现不佳,而我们的AutoT2IS显著优于当前通用甚至专业化的方法。我们的 метод还表明能够实现诸多 underexplored 的实际应用,确认了其巨大的实用价值。访问我们的项目页面:https://chengyou-jia.github.io/T2IS-Home。

关键词

引用

@article{arxiv.2506.23275,
  title  = {Why Settle for One? Text-to-ImageSet Generation and Evaluation},
  author = {Chengyou Jia and Xin Shen and Zhuohang Dang and Zhuohang Dang and Changliang Xia and Weijia Wu and Xinyu Zhang and Hangwei Qian and Ivor W. Tsang and Minnan Luo},
  journal= {arXiv preprint arXiv:2506.23275},
  year   = {2025}
}