中文

仿照人类学习:通过自适应难度课程学习与专家引导的自我重构提升大语言模型推理能力

人工智能 2025-09-18 v2

摘要

尽管在数学推理等领域取得了显著进展,但大型语言模型在持续解决复杂问题方面仍面临重大挑战。我们借鉴了关键人类学习策略,提出了两种新颖的策略来增强大型语言模型解决这些复杂问题的能力。第一种是自适应难度课程学习(Adaptive Difficulty Curriculum Learning, ADCL),这是一种新颖的课程学习策略,通过定期重新估计 upcoming 数据批次中的难度来应对难度迁移现象(即模型对问题难度感知在训练期间动态变化),以保持与模型不断演化能力的一致性。第二种是专家引导的自我重构(Expert-Guided Self-Reformulation, EGSR),这是一种新颖的强化学习策略,通过引导模型在自身概念框架内重新构建专家解决方案,而非依赖直接模仿,来弥合模仿学习与纯粹探索之间的差距,促进更深入的理解和知识吸收。大量实验在使用 Qwen2.5-7B 作为基础模型的具有挑战性的数学推理基准测试上表明,这些人类启发的策略协同且显著提升了性能。值得注意的是,这些策略的组合在 AIME24 基准测试上的性能提升达到了 10%,在 AIME25 上的性能提升达到了 16.6%。

关键词

引用

@article{arxiv.2505.08364,
  title  = {Learning Like Humans: Advancing LLM Reasoning Capabilities via Adaptive Difficulty Curriculum Learning and Expert-Guided Self-Reformulation},
  author = {Enci Zhang and Xingang Yan and Wei Lin and Tianxiang Zhang and Qianchun Lu},
  journal= {arXiv preprint arXiv:2505.08364},
  year   = {2025}
}

备注

14 pages, 3 figs