DDA-Thinker:面向推理驱动图像编辑的解耦双原子强化学习
计算机视觉与模式识别
2026-04-29 v1 人工智能
摘要
近期的图像编辑模型已实现了很强的视觉保真度,但在需要复杂推理的任务上往往表现不佳。为了研究和增强图像编辑中基于推理的规划,我们提出了 DDA-Thinker,这是一个以 Thinker 为中心的框架,旨在对固定生成模型 (Editor) 上的规划模块 (Thinker) 进行独立优化。这种解耦的以 Thinker 为中心的范式促进了对规划模块的受控分析,并使其在固定 Editor 下的贡献更易于评估。为了有效地指导该 Thinker,我们引入了一个双原子强化学习框架。该框架将反馈分解为两个通过可验证清单实现的独立原子奖励:一个认知原子奖励,用于直接评估 Thinker 可执行计划的质量,该计划是 Thinker 推理的可执行结果;另一个是视觉原子奖励,用于评估最终图像质量。为了提高清单质量,我们的清单合成不仅基于源图像和用户指令,还基于对理想编辑后场景的合理参考描述。为了支持这种训练,我们进一步开发了一个两阶段数据筛选流水线,首先合成一个多样化且以推理为重点的数据集,然后应用难度感知的优化来为强化学习策划有效的训练课程。在推理驱动的图像编辑基准 (包括 RISE-Bench 和 KRIS-Bench) 上的大量实验表明,我们的方法显著提升了整体性能。我们的方法使社区模型能够取得与强大专有模型相竞争的结果,突显了在固定 Editor 设置下以 Thinker 为中心的优化的实际潜力。
引用
@article{arxiv.2604.25477,
title = {DDA-Thinker: Decoupled Dual-Atomic Reinforcement Learning for Reasoning-Driven Image Editing},
author = {Hanqing Yang and Qiang Zhou and Yongchao Du and Sashuai Zhou and Zhibin Wang and Jun Song and Tiezheng Ge and Cheng Yu and Bo Zheng},
journal= {arXiv preprint arXiv:2604.25477},
year = {2026}
}