ETCHR:编辑以澄清并利用推理
计算机视觉与模式识别
2026-05-25 v1 人工智能
计算与语言
摘要
多模态大语言模型已取得视觉推理进展,但纯文本链式思考仍是需要精细聚焦或视图转换问题的瓶颈。'以图像思考'范式缩小了这一差距,但现有方法要么受限于固定的预定义工具,要么产生统一多模态方法的噪声中间图像。我们 pursuing 第三种选择:使用专门的图像编辑模型并与理解模型解耦。然而,现有的图像编辑器作为推理助手存在两个互补的差距:语言侧差距在于,训练为被动指令遵循者的编辑器无法将抽象问题映射到合适的视觉转换;生成侧差距在于,随着推理深度增加,编辑正确性会下降。针对这一分析,我们引入 ETCHR(Editing To Clarify and Harness Reasoning),即一种以问题为条件、具有推理感知能力的图像编辑器,与下游理解模型解耦,并通过针对两个差距的两个阶段配方进行训练:针对编辑轨迹的监督微调实现推理模仿,随后利用来自 VLM 的奖励进行推理增强,以提高编辑正确性和下游推理准确性。由于编辑器与解耦,ETCHR 可以无训练方式插入不同的开源和闭源 MLLM 中。在五个任务族(细粒度感知、图表理解、逻辑推理、拼图恢复和 3D 理解)上,ETCHR 以 Qwen3-VL-8B 为基准,平均 Pass@1 从 55.95 提升至 60.77(提升 4.82);以 Gemini-3.1-Flash-Lite 为基准,平均 Pass@1 从 65.08 提升至 70.55(提升 5.47);以 1T 参数 MoE 模型 Kimi K2.5 为基准,平均 Pass@1 从 76.55 提升至 81.16(提升 4.61)。
引用
@article{arxiv.2605.23897,
title = {ETCHR: Editing To Clarify and Harness Reasoning},
author = {Beichen Zhang and Yuhong Liu and Jinsong Li and Yuhang Zang and Jiaqi Wang and Dahua Lin},
journal= {arXiv preprint arXiv:2605.23897},
year = {2026}
}
备注
Code, model and data are open-sourced at https://github.com/InternLM/ETCHR