从元思考到执行:面向通用可靠LLM推理的认知对齐后训练
人工智能
2026-05-29 v2 计算与语言
摘要
当前LLM后训练方法通过监督微调(SFT)随后进行基于结果的强化学习(RL)来优化完整的推理轨迹。虽然有效,但更深入的审视揭示了根本性差距:这种方法未与人类实际解决问题的方式一致。人类认知天然地将问题解决分解为两个 distinct 阶段:首先获取抽象策略(即元知识),这些策略可跨问题通用;其次将其适应到具体情境。在 contrast 中,通过将完整轨迹作为基本单元,当前方法在本质上以问题为中心,将抽象策略与问题特定执行紧密耦合。为此,我们提出一种受认知启发的框架,显式地镜像了两个阶段的人类认知过程。具体而言,Chain-of-Meta-Thought CoMT 聚焦监督学习,专注于抽象推理模式而不包含具体执行,实现可跨问题的策略获取。Confidence-Calibrated Reinforcement Learning (CCRL) 随后通过对中间步骤的置信度敏感奖励进行任务适应优化,防止过度自信的错误级联,提高执行可靠性。跨四种模型和十个基准的实验表明,我们的方法在原方法之上实现了2.10%和3.86%的原分布和外分布提升,同时对教师模型选择、优化方法和符号扰动具有很强鲁棒性。
引用
@article{arxiv.2601.21909,
title = {From Meta-Thought to Execution: Cognitively Aligned Post-Training for Generalizable and Reliable LLM Reasoning},
author = {Shaojie Wang and Liang Zhang},
journal= {arXiv preprint arXiv:2601.21909},
year = {2026}
}