通过自动推导的数据集改进文生图生成中的显式空间关系
计算机视觉与模式识别
2024-03-04 v1 人工智能
摘要
现有工作观察到,当前的文生图系统无法准确反映对象之间的显式空间关系,如“左侧”或“下方”。我们假设这是因为用于训练这些模型的图像标题中很少出现显式空间关系。我们提出了一种自动方法,给定现有图像,生成包含 14 种显式空间关系的合成标题。我们引入了用于生成的空间关系(SR4G)数据集,其中包含 990 万对用于训练的图像 - 标题对,以及超过 6 万条用于评估的标题。为了测试泛化能力,我们还提供了一个“未见”分割,其中训练和测试标题中的对象集合是不相交的。SR4G 是第一个可用于对文生图系统进行空间微调的数据集。我们表明,微调两个不同的 Stable Diffusion 模型(记为 SD)可使 VISOR 指标提高多达 9 个点。这种改进在“未见”分割中依然保持,表明 SD 能够泛化到未见对象。SD 以更少的参数提升了最先进水平,并避免了复杂的架构。我们的分析表明,所有关系的改进都是一致的。数据集和代码将公开可用。
引用
@article{arxiv.2403.00587,
title = {Improving Explicit Spatial Relationships in Text-to-Image Generation through an Automatically Derived Dataset},
author = {Ander Salaberria and Gorka Azkune and Oier Lopez de Lacalle and Aitor Soroa and Eneko Agirre and Frank Keller},
journal= {arXiv preprint arXiv:2403.00587},
year = {2024}
}
备注
12 pages and 5 figures