MIRA:面向图像编辑的多模态迭代推理智能体
计算机视觉与模式识别
2026-02-26 v2
摘要
指令导导的图像编辑为用户以自然语言编辑图像提供了直观的方式。然而,基于扩散的编辑模型往往难以准确解释复杂的用户指令,尤其是涉及组合关系、上下文线索或指代表达式的指令,导致编辑在语义上漂移或未能体现预期的更改。我们通过提出MIRA(Multimodal Iterative Reasoning Agent),一种轻量级、即插即用型多模态推理智能体,通过迭代感知-推理-行动循环来进行编辑,有效模拟了多轮人类-模型交互过程。不同于发出单个提示或静态计划,MIRA逐步预测原子编辑指令,并利用视觉反馈做出决策。我们构建了150K规模的多模态工具使用数据集MIRA-Editing,并辅以两阶段的SFT + GRPO训练管线,使MIRA能够处理复杂编辑指令进行推理与编辑。当与开源图像编辑模型如Flux.1-Kontext、Step1X-Edit和Qwen-Image-Edit配合使用时,MIRA显著提升了语义一致性和感知质量,性能可与或超过专有系统如GPT-Image和Nano-Banana。
引用
@article{arxiv.2511.21087,
title = {MIRA: Multimodal Iterative Reasoning Agent for Image Editing},
author = {Ziyun Zeng and Hang Hua and Jiebo Luo},
journal= {arXiv preprint arXiv:2511.21087},
year = {2026}
}