中文

图像生成中的权衡:不同维度如何相互作用?

计算机视觉与模式识别 2025-07-31 v1

摘要

文本到图像 (T2I) 和图像到图像 (I2I) 生成模型的性能往往取决于多个方面,包括质量、对齐、多样性和鲁棒性。然而,由于 (1) 缺乏允许对这些权衡进行细粒度量化的数据集,以及 (2) 单一指标用于多个维度的使用,模型在这些维度之间复杂权衡鲜有探讨。为弥合这一差距,我们引入了 TRIG-Bench (Trade-offs in Image Generation),涵盖 10 个维度 (现实性、原创性、美学、内容、关系、风格、知识、模糊性、毒性和偏见),包含 40,200 个样本,覆盖 132 个成对维度子集。此外,我们开发了 TRIGScore,即一种自适应应用于各种维度的 VLM 评判指标。基于 TRIG-Bench 和 TRIGScore,我们评估了 14 个模型在 T2I 和 I2I 任务中的表现。我们还提出了关系识别系统,用于生成模型特定能力的维度权衡图 (Dimension Trade-off Map, DTM)。我们的实验表明,DTM 能为每种类型生成模型在维度之间的权衡提供一致的全面理解。值得注意的是,我们展示了通过在 DTM 上进行微调可缓解模型的维度特定弱点,从而提升整体性能。代码地址:https://github.com/fesvhtr/TRIG

关键词

引用

@article{arxiv.2507.22100,
  title  = {Trade-offs in Image Generation: How Do Different Dimensions Interact?},
  author = {Sicheng Zhang and Binzhu Xie and Zhonghao Yan and Yuli Zhang and Donghao Zhou and Xiaofei Chen and Shi Qiu and Jiaqi Liu and Guoyang Xie and Zhichao Lu},
  journal= {arXiv preprint arXiv:2507.22100},
  year   = {2025}
}

备注

Accepted in ICCV 2025, Codebase: https://github.com/fesvhtr/TRIG