面向指令驱动图像调色的 RetouchIQ:通用奖励下的 MLLM 智能体
计算机视觉与模式识别
2026-02-20 v1
摘要
最近的多模态大语言模型(MLLM)进展显示出巨大的潜力,其扩展了面向专业工具的图像编辑的视觉语言推理能力,实现了直观而富有创造性的编辑。一个有前景的方向是使用强化学习(RL)使 MLLM 能够推理并在专业图像编辑软件中执行最优工具使用计划。然而,由于缺乏能够反映创意编辑内在主观性质的可靠、可验证奖励信号,训练仍然具有挑战性。本文介绍 RetouchIQ,一个通过 MLLM 智能体以通用奖励模型为指导,执行指令驱动的可执行图像编辑的框架。RetouchIQ 解释用户指定的编辑意图,生成相应的可执行图像调整,将高层次的审美目标与精确的参数控制相连接。为超越基于常规规则的奖励(这些奖励通过对抄手工metric与固定参考图像的相似性进行计算),我们提出一种通用奖励模型,即一个经过RL微调的 MLLM,通过一组在案例特定基础上生成的metric 对编辑结果进行评估。随后,奖励模型通过多模态推理提供标量反馈,实现基于高质量、指令一致性梯度的强化学习。我们构建了一个包含 19 万条指令-推理配对的扩展数据集,并建立了一个新的基准用于指令驱动的图像编辑。实验表明,RetouchIQ 在语义一致性和感知质量方面显著优于之前的 MLLM-based 和扩散-based 编辑系统。我们的发现表明,通用奖励驱动的 MLLM 智能体作为灵活、可解释且可执行的专业图像编辑助理具有潜力。
引用
@article{arxiv.2602.17558,
title = {RetouchIQ: MLLM Agents for Instruction-Based Image Retouching with Generalist Reward},
author = {Qiucheng Wu and Jing Shi and Simon Jenni and Kushal Kafle and Tianyu Wang and Shiyu Chang and Handong Zhao},
journal= {arXiv preprint arXiv:2602.17558},
year = {2026}
}
备注
10 pages, 6 figures