中文

GThinker:通过线索引导的重新思考迈向通用多模态推理

计算机视觉与模式识别 2025-06-03 v1 人工智能

摘要

尽管多模态推理取得了显著进展,但领先的多模态大语言模型(MLLMs)在一般场景下的以视觉为中心的多模态推理任务中仍然表现不佳。这种不足源于它们主要依赖基于逻辑和知识的慢思考策略,这些策略虽然在数学和科学等领域有效,但在推理过程中无法有效整合视觉信息。因此,这些模型往往无法充分定位视觉线索,导致在需要多种合理视觉解释和推理的任务中表现欠佳。为了解决这一问题,我们提出了 GThinker(General Thinker),这是一种新型推理 MLLM,擅长在一般场景、数学和科学领域的多模态推理。GThinker 引入了 Cue-Rethinking,这是一种灵活的推理模式,将推理基于视觉线索,并迭代地重新解释这些线索以解决不一致性。在此模式的基础上,我们进一步提出了一种两阶段训练流程,包括模式引导的冷启动和激励强化学习,旨在实现跨领域的多模态推理能力。此外,为了支持训练,我们构建了 GThinker-11K,包含 7K 条高质量、迭代标注的推理路径和 4K 条精选的强化学习样本,填补了通用多模态推理的数据空白。大量实验表明,GThinker 在具有挑战性的综合多模态推理基准 M3^3CoT 上取得了 81.5% 的成绩,超越了最新的 O4-mini 模型。它还在一般场景多模态推理基准上平均提升了 2.1%,同时在数学推理方面与同类先进推理模型保持了相当的性能。代码、模型和数据将很快在 https://github.com/jefferyZhan/GThinker 发布。

关键词

引用

@article{arxiv.2506.01078,
  title  = {GThinker: Towards General Multimodal Reasoning via Cue-Guided Rethinking},
  author = {Yufei Zhan and Ziheng Wu and Yousong Zhu and Rongkun Xue and Ruipu Luo and Zhenghao Chen and Can Zhang and Yifan Li and Zhentao He and Zheming Yang and Ming Tang and Minghui Qiu and Jinqiao Wang},
  journal= {arXiv preprint arXiv:2506.01078},
  year   = {2025}
}

备注

Tech report