现象空间中的偏斜阻碍文本到图像生成的泛化
机器学习
2024-11-19 v2 计算机视觉与模式识别
摘要
关于文本到图像生成的文献饱受实体与关系忠实组合问题的困扰。但对于如何有效学习实体-关系组合,尚缺乏形式化的理解。此外,能够有意义地反映问题结构的底层现象空间并未得到明确定义,这导致了一场追求更大数据量的军备竞赛,寄希望于通过大规模预训练涌现出泛化能力。我们假设,底层现象覆盖范围并未按比例扩大,导致所呈现现象的偏斜,从而损害了泛化。我们引入了统计指标来量化数据集在关系学习方面的语言和视觉偏斜,并表明文本到图像生成的泛化失败是现象覆盖不完整或不平衡的直接结果。我们首先在合成领域进行实验,证明系统控制的指标能够强有力地预测泛化性能。然后,我们转向自然图像,并表明根据我们的理论进行简单的分布扰动即可在不扩大绝对数据规模的情况下提升泛化能力。这项工作为提升数据多样性或平衡性(与扩大绝对规模正交)这一重要方向提供了信息。我们的讨论指出了重要的开放性问题:1)对生成的实体-关系组合的评估,以及 2)用于抽象关系推理的更优模型。
引用
@article{arxiv.2403.16394,
title = {Skews in the Phenomenon Space Hinder Generalization in Text-to-Image Generation},
author = {Yingshan Chang and Yasi Zhang and Zhiyuan Fang and Yingnian Wu and Yonatan Bisk and Feng Gao},
journal= {arXiv preprint arXiv:2403.16394},
year = {2024}
}