内联评论者引导图像编辑
计算机视觉与模式识别
2026-05-14 v1 人工智能
摘要
基于指令的数据驱动图像编辑在不同案例之间以及图像不同区域之间表现出异质的难度,这激励了一种在模型困难所在处分配纠正的细化方法。现有的细化信号在完全生成图像或完成去噪步骤后才到达。我们询问,这种信号是否可以在进行中的前向传递期间发挥作用。为此,我们探索了一个冻结的图像编辑模型,发现尽管生成能力仅在后几层中显现,但错误模式已在早期层中确定(与最终层错误图相关系数为 = 0.83)。基于此,我们引入 Inline Critic,这是一种在冻结模型的中间层对其预测进行评论并引导其隐藏状态以在前向传递期间细化生成的可学习标记。我们提出了一个三阶段配方来稳定从学习如何评论到引导生成的训练。结果我们在 GEdit-Bench 上实现了最先进的性能(7.89),在 RISEBench 上获得 +9.4 的提升,并在 KRIS-Bench 上获得最强的开源结果(81.92,超越 GPT-4o)。我们进一步提供了分析,表明评论者真正塑造了模型的注意力和后续层的预测更新。
引用
@article{arxiv.2605.12724,
title = {Inline Critic Steers Image Editing},
author = {Weitai Kang and Xiaohang Zhan and Yizhou Wang and Mang Tik Chiu and Jason Kuen and Kangning Liu and Yan Yan},
journal= {arXiv preprint arXiv:2605.12724},
year = {2026}
}
备注
9 pages