中文

从“啊哈时刻”到可控推理:通过解耦推理与控制实现大规模推理模型的元认知推理

人工智能 2025-08-07 v1

摘要

大规模推理模型(LRM)已通过自发表现出认知行为(如逐步推理、反思和回溯),例如称为“啊哈时刻”,显示出复杂推理的潜在能力。然而,这些涌现行为是不可调节和不可控的,常导致过度思考,即模型在达到可靠结论后仍继续生成冗余的推理内容。这导致计算成本的增加和延迟的增加,限制了LRM在实际部署中的应用。其根本原因在于缺乏内在的调节机制,因为当前模型无法监控和自适应地管理其推理过程以确定何时继续、回溯或终止。为此,我们提出了元认知推理框架(MERA),该框架将思考过程明确地解耦为独立的推理和控制组件,从而实现控制策略的独立优化。具体而言,MERA包含一种接管式数据构建机制,用于识别推理过程中关键决策点,并将控制信号的创建委托给辅助LLM,从而实现高质量推理-控制数据的构建。此外,实施了基于监督微调的结构化推理-控制分离,使模型能够生成明确的轨迹并获得初始的元认知控制能力。最后,MERA采用控制分段策略优化(CSPO),该方法将分段组相对策略优化(GRPO)与控制掩码机制相结合,以在最小化无关内容干扰的同时优化控制行为学习。在各种推理基准测试上的实验表明,使用MERA训练的模型既提高了推理效率,又提高了准确性。

关键词

引用

@article{arxiv.2508.04460,
  title  = {From "Aha Moments" to Controllable Thinking: Toward Meta-Cognitive Reasoning in Large Reasoning Models via Decoupled Reasoning and Control},
  author = {Rui Ha and Chaozhuo Li and Rui Pu and Sen Su},
  journal= {arXiv preprint arXiv:2508.04460},
  year   = {2025}
}