中文

Meta-R1:为大型推理模型赋予元认知能力

人工智能 2025-08-26 v1

摘要

大型推理模型(LRM)在复杂任务上表现出色,展现出涌现的、类似人类的思维模式。尽管已有进展,但我们识别到一种根本性局限性:当前LRM缺乏专门的元认知系统——人类认知中一种使"关于思考的思考"成为可能的关键能力。这一缺失导致其涌现能力不可控(非自适应推理)、不可靠(中间错误)和不灵活(缺乏明确的方法论)。为弥合这一差距,我们引入Meta-R1,一个系统性且通用的框架,为LRM赋予显式的元认知能力。基于认知科学原理,Meta-R1将推理过程分解为独立的对象级和元级组件,在级联框架中组织主动规划、在线调节和自适应提前停止。在三个具有挑战性的基准测试和八个竞争性基线实验中,结果表明Meta-R1:(I)性能卓越,较最先进方法提高最高可达27.3%;(II)token效率高,较其纯文本版本减少27.3%~84.3%的token消耗,效率提升最高可达14.8%;(III)可迁移,在不同数据集和模型骨架上保持稳健性能。

关键词

引用

@article{arxiv.2508.17291,
  title  = {Meta-R1: Empowering Large Reasoning Models with Metacognition},
  author = {Haonan Dong and Haoran Ye and Wenhao Zhu and Kehan Jiang and Guojie Song},
  journal= {arXiv preprint arXiv:2508.17291},
  year   = {2025}
}