中文

强化学习在自回归图像编辑中的潜力

计算机视觉与模式识别 2025-11-19 v3 机器学习

摘要

尽管图像生成技术已能够产生高质量图像,能够满足跨越多个句子的提示,但文本导向的图像编辑仍是一个挑战。即使是仅由几句话组成的编辑请求,也常常未能正确执行。我们探索了三种策略来提升在广泛图像编辑任务上的性能:监督微调(SFT)、强化学习(RL)和链式思考(CoT)推理。为了在一个一致的框架内研究所有这些组件,我们采用了一种自回归多模态模型,该模型以统一的方式处理文本和视觉标记。我们发现,结合大型多模态 LLM 验证器的 RL 是这些策略中最有效的。因此,我们发布了 EARL:Editing with Autoregression and RL,一款强大的基于 RL 的图像编辑模型,在多样化的编辑任务中与强基线竞争,尽管使用的数据量较少。因此,EARL 推动了自回归多模态模型在图像编辑领域的前沿。我们在 https://github.com/mair-lab/EARL 上发布了代码、训练数据和训练好的模型。

关键词

引用

@article{arxiv.2508.01119,
  title  = {The Promise of RL for Autoregressive Image Editing},
  author = {Saba Ahmadi and Rabiul Awal and Ankur Sikarwar and Amirhossein Kazemnejad and Ge Ya Luo and Juan A. Rodriguez and Sai Rajeswar and Siva Reddy and Christopher Pal and Benno Krojer and Aishwarya Agrawal},
  journal= {arXiv preprint arXiv:2508.01119},
  year   = {2025}
}