在键值记忆中引导信息效用以进行语言模型后训练
计算与语言
2025-10-30 v2
摘要
语言模型(LMs)的最新进展标志着向后训练重要性日益增长的转变。然而,诸如监督微调(SFT)之类的后训练方法并不能保证在预训练期间获得的知识得到有效利用。因此,我们引入了InfoSteer,一种轻量级方法,用于在后训练期间鼓励LMs中的参数化信息利用。具体来说,InfoSteer将前馈网络(FFN)层视为关联键值记忆,并通过前向传播干预或反向传播期间的正则化来促进存储的记忆向量的使用。这种在后训练阶段的简单指导在包括Qwen、Gemma和Llama在内的不同模型家族中,在分布内(ID)和分布外(OOD)评估的15个下游任务上产生了一致的性能提升。除了性能提升之外,我们还发现被引导的LMs可以通过将更多重点放在生成语义上有意义的标记上,同时在简单的过渡标记(例如`\texttt{,}'或`\texttt{and}')上使用更少的资源,来自适应地分配信息。我们的工作强调,普通的后训练并未充分利用预训练期间获得的潜力,而在潜在表示空间中引导LMs为提升性能和可解释性提供了一种有前景的方法。代码可在https://github.com/chili-lab/InfoSteer获取。
引用
@article{arxiv.2507.05158,
title = {Steering Information Utility in Key-Value Memory for Language Model Post-Training},
author = {Chunyuan Deng and Ruidi Chang and Hanjie Chen},
journal= {arXiv preprint arXiv:2507.05158},
year = {2025}
}
备注
NeurIPS 2025