中文

基于空间引导的多模态LLM驱动复杂指令图像编辑

计算机视觉与模式识别 2026-02-10 v1 人工智能

摘要

最近的指令式图像编辑方法取得了显著进展,但现有方法仍受限于相对简单的编辑操作,限制了需要复杂和组合指令的实际应用。在本工作中,我们从架构设计、数据和评估协议三个方面针对这些限制进行了改进。具体而言,我们确定了当前模型面临的两个关键挑战:指令遵循不足和背景不一致。为此,我们提出了MCIE-E1方法,这是一种由多模态大型语言模型驱动的复杂指令图像编辑方法,集成了两个关键模块:空间感知跨注意力模块和背景一致性跨注意力模块。前者通过在去噪过程中显式地通过空间引导将语义指令与空间区域对齐,从而增强指令遵循能力;后者保留未编辑区域的特征,以维持背景一致性。为实现有效训练,我们构建了专门的数据管道,以缓解复杂指令式图像编辑数据集稀缺的问题,结合强大的MLLM进行粗粒度自动筛选和严格的人类验证。最后,为全面评估复杂指令式图像编辑,我们引入CIE-Bench基准测试,包含两个新的评估指标。在CIE-Bench上的实验结果表明,MCIE-E1在定性和定量评估方面 consistently 超过以往最先进的方法,在指令遵循方面实现了23.96%的提升。

关键词

引用

@article{arxiv.2602.07993,
  title  = {MCIE: Multimodal LLM-Driven Complex Instruction Image Editing with Spatial Guidance},
  author = {Xuehai Bai and Xiaoling Gu and Akide Liu and Hangjie Yuan and YiFan Zhang and Jack Ma},
  journal= {arXiv preprint arXiv:2602.07993},
  year   = {2026}
}

备注

Accepted by AAAI2026