Uniworld-V2:基于扩散负向微调和 MLLM 隐式反馈强化图像编辑
计算机视觉与模式识别
2025-11-05 v3
摘要
指令式图像编辑取得了显著进展;然而,仅通过监督式微调训练的模型常常过度拟合到注释模式,限制了其在训练分布之外的探索与泛化能力。为此,我们引入了 Edit-R1,这是一种基于策略优化的指令式图像编辑后训练框架。具体而言,我们利用扩散负向微调(DiffusionNFT),这是一种与流匹配前向过程一致的无可能性策略优化方法,从而能够使用更高阶采样器并实现更高效的训练。另一个关键挑战在于缺乏通用奖励模型,这源于编辑指令和任务的多样性。为弥合这一差距,我们采用多模态大语言模型(MLLM)作为统一的、无需训练的奖励模型,利用其输出 logits 提供细粒度反馈。此外,我们仔细设计了低方差分组过滤机制以减少 MLLM 评分噪声并稳定优化。借助该框架训练的 \texttt{UniWorld-V2} 在 ImgEdit 和 GEdit-Bench 数据集上取得 \textbf{最新进展} 成绩,分别得分 4.49 和 7.83。关键在于,我们的框架对模型具有无关性,仅凭应用于 Qwen-Image-Edit 和 FLUX-Kontext 等多样基础模型即可实现显著性能提升,显示其广泛适用性。代码和模型已公开,以支持进一步研究。
引用
@article{arxiv.2510.16888,
title = {Uniworld-V2: Reinforce Image Editing with Diffusion Negative-aware Finetuning and MLLM Implicit Feedback},
author = {Zongjian Li and Zheyuan Liu and Qihui Zhang and Bin Lin and Feize Wu and Shenghai Yuan and Zhiyuan Yan and Yang Ye and Wangbo Yu and Yuwei Niu and Shaodong Wang and Xinhua Cheng and Li Yuan},
journal= {arXiv preprint arXiv:2510.16888},
year = {2025}
}