大语言模型中的稀疏奖励子系统
计算与语言
2026-05-12 v2
摘要
最近的研究表明,LLM 隐藏状态编码与奖励相关的信息,如答案正确性和模型置信度。然而,现有方法通常在完整隐藏状态上拟合黑箱探针,难以洞察该信息在神经元间的结构。本文我们表明,奖励相关信息集中在稀疏子神经元中。通过简单探针,我们识别出两种神经元:价值神经元,其激活值预测状态价值;多巴胺神经元,其激活值编码步骤级时间差(TD)误差。这些神经元在 LLM 隐藏状态中形成稀疏奖励子系统。这些名称类比自神经科学,其中价值神经元和多巴胺神经元在生物奖励子系统中分别编码价值和奖励预测误差。我们展示,价值神经元在各种数据集和模型间具有稳健性和可迁移性,提供因果证据表明其编码奖励相关信息。最后,我们展示奖励子系统的应用:价值神经元可作为模型置信度的有效预测器,多巴胺神经元可作为过程奖励模型(PRM)指导推理时间搜索。
引用
@article{arxiv.2602.00986,
title = {Sparse Reward Subsystem in Large Language Models},
author = {Guowei Xu and Mert Yuksekgonul and James Zou},
journal= {arXiv preprint arXiv:2602.00986},
year = {2026}
}