元认知提升推理模型:自对齐强化学习
机器学习
2025-10-07 v1 人工智能
摘要
近期研究探索语言模型的元认知,即模型自身认识如何思考的能力。我们认为大型推理模型缺乏这种元认知属性,通过证明真实 rollout 与预测元信息之间的严重错位来支持这一观点。我们认为,将元预测与真实 rollout 对齐将带来显著的性能提升。为验证这一假设,我们设计了提升元认知的训练管道(MASA),并证明增强后的元认知直接转化为更高的准确率。不同于现有元认知推理模型,本方法无需外部训练来源,而是利用自生成信号训练元认知。此外,本方法通过i)过滤零方差提示(要么平凡,要么不可解) ii)切断不太可能得出正确答案的冗长 rollout来实现高效训练。结果令人鼓舞:本策略在域内任务上显著提升准确率和训练效率,并在域外基准测试中表现出强大的泛化能力。具体而言,本方法可将GRPO训练加速超过1.28倍以达到相同性能,在AIME25上实现19.3%的准确率提升,在六个数学基准上实现6.2%的平均提升。在元认知指导下训练可增强域外泛化,在GPQA-Diamond上提升3.87%,在覆盖逻辑、科学和编码领域的13个基准上实现2.08%的总体准确率提升。
引用
@article{arxiv.2510.03259,
title = {Meta-Awareness Enhances Reasoning Models: Self-Alignment Reinforcement Learning},
author = {Yoonjeon Kim and Doohyuk Jang and Eunho Yang},
journal= {arXiv preprint arXiv:2510.03259},
year = {2025}
}
备注
preprint