中文

SketchThinker-R1:面向大型多模态模型的高效草图式推理

计算机视觉与模式识别 2026-01-07 v1

摘要

尽管大型多模态模型中基于广泛、逐步推理的实证成功,但长推理过程不可避免地导致显著的计算开销,即更高的 token 成本和增加的响应时间,从而削弱了推理效率。相反,人类常用草图式推理:一种简洁、以目标为导向的认知过程,优先考虑关键信息,使问题解决更高效。以这种认知效率为灵感,我们提出了 SketchThinker-R1,激励大型多模态模型具备草图式推理能力。我们的方法由三个主要阶段组成。在草图模式冷启动阶段,我们将标准的长推理过程转换为草图式推理,并微调基本多模态模型,以灌输初始的草图式推理能力。接着,我们训练 SketchJudge 奖励模型,该模型显式评估模型的思考过程,并对草图式推理给出更高的评分。最后,我们在 SketchJudge 的监督下进行 Sketch-Thinking 强化学习,以进一步泛化草图式推理能力。实验评估显示,我们的 SketchThinker-R1 在四个基准测试中实现了超过 64% 的推理 token 成本降低,同时未损害最终答案准确性。定性分析进一步表明,草图式推理在问题解决过程中更关注关键线索。

关键词

引用

@article{arxiv.2601.02825,
  title  = {SketchThinker-R1: Towards Efficient Sketch-Style Reasoning in Large Multimodal Models},
  author = {Ruiyang Zhang and Dongzhan Zhou and Zhedong Zheng},
  journal= {arXiv preprint arXiv:2601.02825},
  year   = {2026}
}

备注

28 pages, 11 figures