ReasonCACHE:教会 LLM 进行无权重更新的推理
机器学习
2026-02-03 v1 人工智能
摘要
大型语言模型 (LLM) 在不进行任何权重更新,仅通过 in-context 学习 (ICL) 学习推理能力是否可能?ICL 具有显著的样本效率,通常只需少量演示即可学习,但复杂推理任务通常需要大量训练示例。然而,单纯通过增加演示来扩展 ICL 在这一尺度上会导致注意力成本呈二次增长,性能在更长的上下文长度下会饱和或恶化,该方法仍然是一种浅层的学习形式。由于这些限制,实践者主要依赖 in-weight 学习 (IWL) 来诱导推理。在本工作中,我们表明通过使用 Prefix Tuning,LLM 可以在不超载上下文窗口的情况下进行推理学习,且无需任何权重更新。我们引入了 ,该机制将演示蒸馏到固定的 key-value 缓存中。经验上,在包括 GPQA-Diamond 在内的多个具有挑战性的推理基准测试中,ReasonCACHE 在标准 ICL 和 IWL 方法中均表现出色。进一步地,它在三个关键维度上(数据、推理成本和可训练参数)都更为高效。我们还从理论上证明了 ReasonCACHE 在表达性方面严格优于低秩权重更新,因为后者将表达性绑定到输入秩,而 ReasonCACHE 通过直接将 key-value 注入注意力机制来规避这一限制。我们一起的发现确定了 ReasonCACHE 作为 in-context 学习和 in-weight 学习之间的中间路径,为在不修改参数的情况下超越上下文窗口学习推理技能提供了可扩展算法。我们的项目页面:https://reasoncache.github.io/
引用
@article{arxiv.2602.02366,
title = {ReasonCACHE: Teaching LLMs To Reason Without Weight Updates},
author = {Sharut Gupta and Phillip Isola and Stefanie Jegelka and David Lopez-Paz and Kartik Ahuja and Mark Ibrahim and Mohammad Pezeshki},
journal= {arXiv preprint arXiv:2602.02366},
year = {2026}
}
备注
26 pages, 17 Figures