超越‘啊哈!:向大规模推理模型中的系统性元能力对齐
计算与语言
2025-05-28 v2
摘要
大规模推理模型 (LRM)已具备长链思考推理的潜在能力。 先前工作表明,基于结果的强化学习 (RL) 可偶然激发自我纠正、回溯和验证等高级推理行为,常被称为模型“啊哈时刻”。 然而,这些涌现行为的时机和一致性仍不可预测且不可控,限制了LRM推理能力的可扩展性和可靠性。 为了克服这些限制,我们不再依赖提示和偶然的“啊哈时刻”。 相反,我们使用自动生成的自验证任务,显式对模型进行三种元能力的对齐:演绎、归纳和归谬。 我们采用三阶段管线:单独对齐、参数空间合并和领域特定强化学习,将性能提升超过10%。 此外,来自对齐检查点的领域特定RL为7B和32B模型在数学、编码和科学基准测试中带来了额外的性能提升,表明显式的元能力对齐为推理提供了可扩展且可靠的基础。 代码已公开:https://github.com/zhiyuanhubj/Meta-Ability-Alignment
引用
@article{arxiv.2505.10554,
title = {Beyond 'Aha!': Toward Systematic Meta-Abilities Alignment in Large Reasoning Models},
author = {Zhiyuan Hu and Yibo Wang and Hanze Dong and Yuhui Xu and Amrita Saha and Caiming Xiong and Bryan Hooi and Junnan Li},
journal= {arXiv preprint arXiv:2505.10554},
year = {2025}
}
备注
In Progress