SATURN:由场景图引导的自回归图像生成
计算机视觉与模式识别
2025-08-21 v1
摘要
最先进的文本到图像模型在逼真渲染方面表现出色,但往往难以捕捉复杂提示所隐含的布局和物体关系。场景图提供了一种自然的先验结构,然而以往的图引导方法通常依赖于庞大的 GAN 或扩散管道,这些管道在速度和保真度方面均落后于现代自回归架构。我们引入了 SATURN(用于统一渲染网络的三元组结构化排列),这是对 VAR-CLIP 的一种轻量级扩展,它将场景图转换为按显著性排序的令牌序列,使得一个冻结的 CLIP-VQ-VAE 骨干网络能够解释图结构,同时仅微调 VAR 变换器。在 Visual Genome 数据集上,SATURN 将 FID 从 56.45% 降至 21.62%,并将 Inception Score 从 16.03 提升至 24.78,性能优于 SG2IM 和 SGDiff 等先前方法,且无需额外模块或多阶段训练。定性结果进一步证实了在对象计数保真度和空间关系准确性方面的改进,表明 SATURN 有效地将结构感知与最先进的自回归保真度结合了起来。
引用
@article{arxiv.2508.14502,
title = {SATURN: Autoregressive Image Generation Guided by Scene Graphs},
author = {Thanh-Nhan Vo and Trong-Thuan Nguyen and Tam V. Nguyen and Minh-Triet Tran},
journal= {arXiv preprint arXiv:2508.14502},
year = {2025}
}
备注
Accepted to MAPR 2025