13 参数下的推理学习
机器学习
2026-02-05 v1
摘要
近期研究表明,语言模型可以通过强化学习学习进行推理。一些工作甚至训练低秩参数化以进行推理,但常规的 LoRA 无法缩放至模型维度以下。我们质疑即使秩为 1 的 LoRA 是否是学习推理所必需的,提出 TinyLoRA,一种可将低秩适配器缩放至仅一个参数的方法。在我们的新参数化框架中,我们能够仅使用 13 个训练参数(bf16 下为 26 字节)将 80 亿参数规模的 Qwen2.5 在 GSM8K 上训练到 91% 的准确率。我们发现这一趋势在一般情况下也成立:我们能够在更困难的学习推理基准测试(如 AIME、AMC 和 MATH500)中以仅训练 1000 倍更少的参数的情况下恢复 90% 的性能提升。值得注意的是,我们只有在使用 RL 时才能实现如此强的性能:使用 SFT 训练的模型需放大 100-1000 倍的更新才能达到相同的性能。
引用
@article{arxiv.2602.04118,
title = {Learning to Reason in 13 Parameters},
author = {John X. Morris and Niloofar Mireshghallah and Mark Ibrahim and Saeed Mahloujifar},
journal= {arXiv preprint arXiv:2602.04118},
year = {2026}
}