文本到图像生成模型中的渐进式组合性
计算机视觉与模式识别
2025-04-29 v2 机器学习
摘要
尽管扩散模型在文本到图像(T2I)合成方面展现了惊人的能力,但它们往往在理解复杂情境中对象和属性之间的组合关系方面存在挑战。现有方法通过优化交叉注意力机制或从带有最小语义变化的标题对中学习来应对这些挑战。然而,我们能否生成扩散模型能够直接基于视觉表征进行鉴别的高质量复杂对比图像?本文我们利用大型语言模型(LLM)组合真实、复杂情景,并借助视觉-问题答复(VQA)系统与扩散模型合作,自动筛选出包含15000对高质量对比图像的对照数据集(ConPair)。这些对比图像特征最小的视觉差异,涵盖广泛的属性类别,尤其是复杂且自然的情境。为有效学习这些错误案例,即难负样本图像,我们提出EvoGen,这是一种用于扩散模型对比学习的新型多阶段课程。通过在广泛的组合场景上进行大量实验,我们展示了该提议框架在组合T2I基准测试中的有效性。
引用
@article{arxiv.2410.16719,
title = {Progressive Compositionality in Text-to-Image Generative Models},
author = {Evans Xu Han and Linghao Jin and Xiaofeng Liu and Paul Pu Liang},
journal= {arXiv preprint arXiv:2410.16719},
year = {2025}
}