MSRAMIE:基于结构化多模态推理的多指令图像编辑代理
计算机视觉与模式识别
2026-03-19 v1 人工智能
摘要
现有的基于指令的图像编辑模型在处理简单、单步骤指令时表现良好,但在涉及多个、长期且相互关联指令的真实场景中性能会下降。其主要原因是缺乏包含复杂多指令标注的训练数据。然而,收集此类数据并重新训练模型成本很高。为解决这一挑战,我们提出MSRAMIE,一个基于多模态大语言模型(MLLM)的训练-free代理框架。MSRAMIE将现有的编辑模型作为可插拔组件,通过结构化的多模态推理来处理多指令任务。它协调MLLM-based指令器与图像编辑演员之间的迭代交互,引入一种新颖的推理拓扑,包括提出的“树形状态”(Tree-of-States)和“引用图”(Graph-of-References)。在推理阶段,复杂指令被分解为多个编辑步骤,以实现状态转换、跨步骤信息聚合和原始输入回顾,从而系统地探索图像编辑空间并实现灵活的渐进式输出细化。可视化的推理拓扑进一步提供了可解释且可控制的决策路径。实验表明,随着指令复杂度的增加,MSRAMIE在指令遵循方面可提高超过15%,在单次运行中完成所有修改的概率提高超过100%,同时保持感知质量并维持视觉一致性。
引用
@article{arxiv.2603.16967,
title = {MSRAMIE: Multimodal Structured Reasoning Agent for Multi-instruction Image Editing},
author = {Zhaoyuan Qiu and Ken Chen and Xiangwei Wang and Yu Xia and Sachith Seneviratne and Saman Halgamuge},
journal= {arXiv preprint arXiv:2603.16967},
year = {2026}
}
备注
14 pages, 6 figures, 3 tables, appendix and references provided