Uni-Edit:智能编辑是统一模型调优的通用任务
计算机视觉与模式识别
2026-05-25 v2
摘要
目前,增强统一多模态模型(UMMs)具备图像理解、生成和编辑能力主要依赖混合多任务训练。由于任务间固有的冲突,这种策略需要复杂的多阶段管道、大量数据混合和平衡技巧,仅导致性能之间的权衡,而非真正的相互强化。为突破这一范式,我们提出 Uni-Edit,一种智能图像编辑任务,作为 UMM 调优的第一个通用任务。不同于复杂的混合管道,Uni-Edit 只使用一个任务、一个训练阶段和一个数据集,即可同时提升所有三项能力。具体而言,我们首先确定图像编辑本身就是一个理想的通用任务,因为它自然需要视觉理解和生成。然而,现有的编辑数据依赖于简陋的指令严重未充分利用模型的理解能力。为解决此问题,我们引入了第一个自动且可扩展的数据合成管道,将多样化的 VQA 数据转化为带有嵌入问题和嵌套逻辑的复杂且有效的编辑指令。这产生了 Uni-Edit-148k,将多样化的推理密集型指令与高质量编辑后的图像配对。在 BAGEL 和 Janus-Pro 上进行的大量实验表明,仅依据 Uni-Edit 进行调优即可在没有任何辅助操作的情况下实现所有三项能力的全面提升。
引用
@article{arxiv.2605.21487,
title = {Uni-Edit: Intelligent Editing Is A General Task For Unified Model Tuning},
author = {Dian Zheng and Manyuan Zhang and Hongyu Li and Hongbo Liu and Kai Zou and Kaituo Feng and Hongsheng Li},
journal= {arXiv preprint arXiv:2605.21487},
year = {2026}
}
备注
Project Page: https://zhengdian1.github.io/Uni-Edit-proj/ Code: https://github.com/zhengdian1/Uni-Edit