微预算下低秩适配器对推理的影响:塑性与刚性之争
机器学习
2026-01-13 v1 人工智能
摘要
近期在数学推理领域的进展通常依赖于大规模模型,但一个关键问题仍未解决:在极端约束下,是否可以为小型语言模型(≤1.5B参数)诱导出强大的推理能力?我们通过在单张48GB A40 GPU上训练不超过24小时,使用可验证奖励强化学习(RLVR)和低秩适配器(LoRA)来探索此问题。我们发现,这种“微预算” regime 的成功取决于适配器容量与模型初始化之间的关键相互作用。虽然低秩适配器(r=8)持续失败于捕捉推理优化动力学的复杂性,但高秩适配器(r=256)在标准指令调优模型中解锁了显著的塑性。我们的最佳结果在AIME 24上实现了40.0%的Pass@1(相较于基线提升了11.1%),并将Pass@16推至70.0%,显示出强大的探索能力。然而,这种塑性并非普遍适用:指令调优模型利用预算延长链式思维并最大化奖励,而深度数学对齐模型则出现性能崩溃,这表明在噪声环境下的低预算RL更新可能对已接近任务特定最优点的模型产生破坏性干扰。
引用
@article{arxiv.2601.06677,
title = {Plasticity vs. Rigidity: The Impact of Low-Rank Adapters on Reasoning on a Micro-Budget},
author = {Zohaib Khan and Omer Tafveez and Zoha Hayat Bhatti},
journal= {arXiv preprint arXiv:2601.06677},
year = {2026}
}
备注
9 pages, 4 figures, 2 tables