SimpleAR:通过预训练、监督微调与强化学习推进自回归视觉生成的前沿
计算机视觉与模式识别
2025-04-16 v1
摘要
本文提出了 SimpleAR——一种不含复杂架构修改的原生自回归视觉生成框架。通过对训练与推理优化的细致探索,我们证明:1) 仅使用 0.5B 参数,我们的模型即可生成高保真度的 1024×1024 分辨率图像,并在具有挑战性的文生图基准上取得具有竞争力的结果,例如在 GenEval 上达到 0.59、在 DPG 上达到 79.66;2) 监督微调(SFT)与组相对策略优化(GRPO)训练均可显著提升生成美学质量与提示词对齐度;3) 在采用 vLLM 等推理加速技术进行优化后,SimpleAR 生成一张 1024×1024 图像的时间可缩短至约 14 秒。通过分享这些发现并开源代码,我们希望揭示自回归视觉生成的潜力,并鼓励更多研究者参与该领域。代码地址:https://github.com/wdrink/SimpleAR。
引用
@article{arxiv.2504.11455,
title = {SimpleAR: Pushing the Frontier of Autoregressive Visual Generation through Pretraining, SFT, and RL},
author = {Junke Wang and Zhi Tian and Xun Wang and Xinyu Zhang and Weilin Huang and Zuxuan Wu and Yu-Gang Jiang},
journal= {arXiv preprint arXiv:2504.11455},
year = {2025}
}
备注
technical report, work in progress