中文

生成任意场景:场景图驱动的数据合成用于视觉生成训练

计算机视觉与模式识别 2026-03-18 v4 人工智能 机器学习

摘要

近期文本到视觉生成技术在视觉保真度方面表现出色,但在组合泛化和语义对齐方面存在困难。现有数据集噪声大且组合性弱,限制了模型对复杂场景的理解,而针对密集、高质量标注的可扩展解决方案仍是一个挑战。我们提出Generate Any Scene,一个系统枚举可能视觉场景组合数组的场景图数据引擎。Generate Any Scene从结构化的物体、属性和关系分类法中动态构建不同复杂度的场景图。给定一个采样场景图,Generate Any Scene将其转换为文本到图像或文本到视频生成的描述;同时将其转换为一组视觉问答对,用于语义对齐的自动评估和奖励建模。使用Generate Any Scene,我们首先设计了一个自我改进框架,模型利用生成的数据迭代提升性能。Stable Diffusion v1.5相比基线平均提升4%,并超越了CC3M上的微调结果。其次,我们还设计了一种蒸馏算法,将专有模型的特定优势迁移到其开源对应模型上。使用少于800个合成描述,我们微调Stable Diffusion v1.5,在组合和难概念生成上TIFA分数提升10%。第三,我们创建了一个奖励模型,以低成本将模型生成与语义准确性对齐。使用GRPO算法,我们微调SimpleAR-0.5B-SFT,在DPG-Bench上超越了基于CLIP的方法+5%。最后,我们将这些思想应用于内容审核的下游任务,通过从合成数据中学习来训练模型识别具有挑战性的案例。

关键词

引用

@article{arxiv.2412.08221,
  title  = {Generate Any Scene: Scene Graph Driven Data Synthesis for Visual Generation Training},
  author = {Ziqi Gao and Weikai Huang and Jieyu Zhang and Aniruddha Kembhavi and Ranjay Krishna},
  journal= {arXiv preprint arXiv:2412.08221},
  year   = {2026}
}

备注

ICLR 2026