EditThinker:解锁图像编辑中的迭代推理
计算机视觉与模式识别
2025-12-08 v1
摘要
基于指令的数据驱动图像编辑已成为热门研究领域,得益于图像生成基础模型,已在审美质量方面取得高水平成就,但指令遵循能力仍是主要挑战。现有方法通过监督学习或强化学习提升指令遵循,但单轮成功率仍受限于固有的随机性和缺乏 deliberation。为此,本文提出一种 deliberative 编辑框架,模拟人类认知循环,通过迭代执行 Think-While-Edit 循环:批判结果、精炼指令,然后重复生成直至满意。具体而言,我们训练一个单一的 MLLM,EditThinker,作为该框架的推理引擎,联合生成批判得分、推理过程和精炼指令。我们采用强化学习将 EditThinker 的思考与其编辑过程对齐,从而生成更具针对性的指令改进。广泛实验表明,我们的方法在四个基准数据集上显著提升了任何图像编辑模型的指令遵循能力。我们将发布数据构建框架、数据集和模型,以利于社区发展。
引用
@article{arxiv.2512.05965,
title = {EditThinker: Unlocking Iterative Reasoning for Any Image Editor},
author = {Hongyu Li and Manyuan Zhang and Dian Zheng and Ziyu Guo and Yimeng Jia and Kaituo Feng and Hao Yu and Yexin Liu and Yan Feng and Peng Pei and Xunliang Cai and Linjiang Huang and Hongsheng Li and Si Liu},
journal= {arXiv preprint arXiv:2512.05965},
year = {2025}
}
备注
Project page: https://appletea233.github.io/think-while-edit