中文

Cog-Rethinker:用于LLM推理的层次化元认知强化学习

机器学习 2025-10-21 v1 人工智能

摘要

当代大型语言模型(LLM)的进展揭示了通过强化学习(RL)实现的显著推理能力,这类方法利用可验证的奖励信号,推动了O1和R1等推理模型的发展。直接基于底层模型进行RL训练称为零RL训练。然而,先前方法依赖固定提示模板激活LLM的内在能力,导致弱LLM在推理任务中因准确率驱动的筛选产生大量无效输出,从而造成样本浪费。为解决此问题,我们提出Cog-Rethinker,一种用于LLM推理的层次化元认知RL框架。Cog-Rethinker主要聚焦于RL训练中的 rollout 过程。经过直接 rollout 后,Cog-Rethinker在层次化元认知双阶段框架中提高了样本利用率。通过借鉴人类解题思维,首先引导策略将零准确率问题分解为子问题以生成最终推理结果;其次,针对前一阶段的零准确率问题,引导策略参考先前错误解答进行细化。为实现双新推理模式的冷启动并维持跨提示模板的训练-测试一致性,Cog-Rethinker采用正确样本进行监督式微调。实验结果表明,Cog-Rethinker在各种数学推理基准测试中表现优异,并通过分析其加速收敛的样本效率优势。

关键词

引用

@article{arxiv.2510.15979,
  title  = {Cog-Rethinker: Hierarchical Metacognitive Reinforcement Learning for LLM Reasoning},
  author = {Zexu Sun and Yongcheng Zeng and Erxue Min and Heyang Gao and Bokai Ji and Xu Chen},
  journal= {arXiv preprint arXiv:2510.15979},
  year   = {2025}
}

备注

22 Pages, 8 figures, 4 tables