中文

EduFlow: 通过多阶段、多视角批判提升多模态大语言模型的问题解决能力

人工智能 2025-07-15 v1

摘要

多模态大语言模型(MLLMs)在科学任务上表现仍然不佳,特别是那些需要多步骤和可解释推理的任务。它们的局限性包括:科学推理模式不足、多步推理中缺乏全局连贯性,以及缺乏反思性自我修正,这使得它们在结构化科学语境中不可靠。我们引入EduFlow,这是第一个覆盖教育科学推理完整流程的端到端框架,包括数据选择、基于MCTS的轨迹构建、模型训练和输出优化。其核心是EduPRM,一个过程感知的奖励模型,它使用标签和理由来批判推理步骤。EduPRM通过课程学习在三个互补的监督源上进行训练:MCTS引导的轨迹、注入错误的批判和师生对话,使其能够动态适应多阶段问题求解和推理过程中的迭代优化。我们进一步提出EduMCTS,一个领域自适应的搜索框架,它引入了专门为教育推理设计的引导动作,例如促进反思性错误修正的自我反思机制。它还利用EduPRM的细粒度反馈来引导搜索走向更高质量的推理轨迹。通过应用自一致性和拒绝采样,我们构建了EduMCTS-160K,一个大规模的教育推理轨迹数据集。大量实验表明,EduFlow增强了推理的一致性和连贯性。代码、数据和模型将公开发布。

关键词

引用

@article{arxiv.2507.09374,
  title  = {EduFlow: Advancing MLLMs' Problem-Solving Proficiency through Multi-Stage, Multi-Perspective Critique},
  author = {Chenglin Zhu and Tao Zhang and Chong Li and Mingan Lin and Zenan Zhou and Jian Xie},
  journal= {arXiv preprint arXiv:2507.09374},
  year   = {2025}
}

备注

14 pages,4 figures