基于结构化掩码的布局条件自回归文本到图像生成
计算机视觉与模式识别
2025-09-16 v1 人工智能
摘要
虽然自回归(AR)模型在图像生成方面已展现出显著的成功,但将其扩展到布局条件生成仍面临稀疏布局条件和特征纠缠的挑战。我们提出Structured Masking for AR-based Layout-to-Image(SMARLI),一种新型框架,用于布局到图像的生成,有效地将空间布局约束集成到AR-based图像生成中。为使AR模型具备布局控制,我们应用专门设计的结构化掩码策略来计算注意力,从而控制全局提示、布局和图像标记之间的相互作用。这种设计防止了不同区域及其描述之间的错误关联,同时实现了对生成过程的充分布局约束注入。为进一步提升生成质量和布局精度,我们采用基于Group Relative Policy Optimization(GRPO)的后训练方案,并设计了针对下一个集合基于AR模型的布局奖励函数。实验结果表明,SMARLI能够无缝地将布局标记与文本和图像标记集成,同时不损害生成质量,实现了对布局感知的优越控制,同时保持了AR模型的结构简单性和生成效率。
引用
@article{arxiv.2509.12046,
title = {Layout-Conditioned Autoregressive Text-to-Image Generation via Structured Masking},
author = {Zirui Zheng and Takashi Isobe and Tong Shen and Xu Jia and Jianbin Zhao and Xiaomin Li and Mengmeng Ge and Baolu Li and Qinghe Wang and Dong Li and Dong Zhou and Yunzhi Zhuge and Huchuan Lu and Emad Barsoum},
journal= {arXiv preprint arXiv:2509.12046},
year = {2025}
}
备注
10 pages, 3 figures