ETCHR:编辑以澄清并利用推理
高能物理 - 唯象学
2026-05-25 v1
摘要
多模态大语言模型已取得进展,使其在视觉推理方面取得显著成果,但纯文本的链式思考仍是需要精细聚焦或视图转换问题时的瓶颈。'以图像思考'范式缩小了这一差距,但现有方法要么受限于固定的预定义工具集,要么产生来自统一多模态方法的噪声中间图像。我们 pursuing 第三种选择:使用专门的图像编辑模型并与理解模型解耦。然而,现有的图像编辑器作为推理助手存在两个互补的差距:语言侧差距在于,训练为被动指令遵循者的编辑器无法将抽象问题映射到合适的视觉转换;生成侧差距在于,随着推理深度增加,编辑正确性会下降。针对这一分析,我们引入了 ETCHR(Editing To Clarify and Harness Reasoning),一种以问题为条件、具备推理感知性质的图像编辑器,与下游理解模型解耦,并通过针对两个差距的两个阶段配方进行训练:针对编辑轨迹的推理模仿通过监督微调实现,随后利用基于 VLM 的奖励进行推理增强,以提高编辑正确性和下游推理准确性。由于编辑器与理解模型解耦,ETCHR 可以无训练方式插入不同的开源和闭源 MLLM 中。在五个任务族(精细感知、图表理解、逻辑推理、拼图恢复和 3D 理解)上,ETCHR 将 Qwen3-VL-8B 的平均 Pass@1 从 55.95 提升至 60.77(提升 4.82),从 65.08 提升至 70.55(提升 5.47),从 76.55 提升至 81.16(提升 4.61)。
引用
@article{arxiv.2605.23896,
title = {A Stochastic Approach for Determining the Quark Confinement Potential of Charmonia},
author = {Ahmet Bingul and Altug Ozpineci},
journal= {arXiv preprint arXiv:2605.23896},
year = {2026}
}
备注
15 pages, 6 tables, 3 figures