中文

LAION-SG:用于训练带结构注释的复杂图像-文本模型的增强大规模数据集

计算机视觉与模式识别 2024-12-16 v2

摘要

最近的文本到图像(T2I)生成技术在从文本生成高质量图像方面取得了显著进展。然而,现有T2I模型在涉及多个物体及其复杂关系的组合图像生成任务中表现下降。我们认为这一问题源于现有图像-文本配对数据集缺乏对物体间精确关系的注释,仅凭提示词难以实现。为此,我们构建了LAION-SG数据集,包含大规模且高质量的场景图(SG)结构注释,这些注释精确描述了多个物体的属性和关系,有效地代表了复杂场景的语义结构。基于LAION-SG,我们训练了一个新的基础模型SDXL-SG,将结构注释信息融入生成过程。大量实验表明,在我们构建的LAION-SG上训练的先进模型在复杂场景生成方面显著优于现有数据集上的模型。我们还引入了CompSG-Bench基准测试,评估模型在组合图像生成任务中的性能,确立了该领域的新标准。我们的注释数据及其关联的处理代码、基础模型和基准测试协议均已公开发布于https://github.com/mengcye/LAION-SG。

关键词

引用

@article{arxiv.2412.08580,
  title  = {LAION-SG: An Enhanced Large-Scale Dataset for Training Complex Image-Text Models with Structural Annotations},
  author = {Zejian Li and Chenye Meng and Yize Li and Ling Yang and Shengyuan Zhang and Jiarui Ma and Jiayi Li and Guang Yang and Changyuan Yang and Zhiyuan Yang and Jinxiong Chang and Lingyun Sun},
  journal= {arXiv preprint arXiv:2412.08580},
  year   = {2024}
}