Lego-Edit:一个具有模型级积木和多模态大语言模型构建器的通用图像编辑框架
计算机视觉与模式识别
2025-09-17 v1
摘要
基于指令的图像编辑因其与用户的直接交互而受到广泛关注。然而,现实世界的用户指令极其多样,现有方法通常无法有效泛化到其训练领域之外的指令,限制了它们的实际应用。为了解决这个问题,我们提出了Lego-Edit,它利用多模态大语言模型(MLLM)的泛化能力来组织一套模型级编辑工具以应对这一挑战。Lego-Edit包含两个关键设计:(1)一个模型级工具包,包含在有限数据上高效训练的多种模型和若干图像处理函数,使MLLM能够对编辑动作进行细粒度组合;(2)一种三阶段渐进式强化学习方法,利用对未标注的开放域指令的反馈来训练MLLM,使其具备处理现实世界指令的泛化推理能力。实验表明,Lego-Edit在GEdit-Bench和ImgBench上实现了最先进的性能。它对开放域指令展现出强大的推理能力,并且无需额外微调即可使用新引入的编辑工具。代码可用:https://github.com/xiaomi-research/lego-edit。
引用
@article{arxiv.2509.12883,
title = {Lego-Edit: A General Image Editing Framework with Model-Level Bricks and MLLM Builder},
author = {Qifei Jia and Yu Liu and Yajie Chai and Xintong Yao and Qiming Lu and Yasen Zhang and Runyu Shi and Ying Huang and Guoquan Zhang},
journal= {arXiv preprint arXiv:2509.12883},
year = {2025}
}