中文

ImageEdit-R1:基于强化学习提升多智能体图像编辑

计算机视觉与模式识别 2026-03-10 v1 人工智能

摘要

随着商业多模态模型的快速发展,图像编辑因其在日常生活中的广泛应用而受到广泛关注。尽管取得了显著进展,但现有的图像编辑系统,特别是封闭源或专有模型,往往在处理复杂、间接或多步骤用户指令时仍感困难。这些限制阻碍了其执行细致、情境感知的编辑,以符合人类意图。为此,我们提出了 ImageEdit-R1,一个利用强化学习在一组专门预训练的视觉语言与生成智能体之间进行高层决策协调的多智能体框架。每个智能体负责 distinct 能力——例如理解用户意图、识别感兴趣区域、选择合适的编辑动作以及合成视觉内容——而强化学习则主导它们的协作,以确保协同且目标导向的行为。不同于依赖单一模型或手工制作的管道的现有方法,我们的方法将图像编辑视为一个顺序决策问题,实现动态且情境感知的编辑策略。实验结果表明,ImageEdit-R1 在多个图像编辑数据集上 consistently 优于单个封闭源扩散模型和其他多智能体框架基线。

关键词

引用

@article{arxiv.2603.08059,
  title  = {ImageEdit-R1: Boosting Multi-Agent Image Editing via Reinforcement Learning},
  author = {Yiran Zhao and Yaoqi Ye and Xiang Liu and Michael Qizhe Shieh and Trung Bui},
  journal= {arXiv preprint arXiv:2603.08059},
  year   = {2026}
}