从LLM隐藏状态中挖掘内在奖励以实现高效Best-of-N采样
机器学习
2026-01-09 v3 人工智能
计算与语言
机器学习
摘要
Best-of-N采样是提升大语言模型(LLM)性能的一种强大方法,但其通常受限于对大规模、基于文本的奖励模型的依赖。这些模型不仅计算成本高昂,而且数据需求量大,需要大量带标签的数据集进行训练。这带来了一个显著的数据挑战,因为它们忽略了一个丰富且易于获取的数据源:LLM自身的内部隐藏状态。为了解决这一数据和效率差距,我们引入了SWIFT(简单加权内在反馈技术),这是一种新颖且轻量级的方法,它直接从嵌入在LLM隐藏状态中的丰富信息中学习奖励函数。SWIFT在词元嵌入级别上运行,采用简单的线性层来有效区分偏好和非偏好的生成结果,从而消除了对计算密集型基于文本建模的需求。在标准基准上的大量实验表明,SWIFT的性能优于现有基线(在MATH数据集上比EurusRM-7B的准确率高12.7%),同时使用的参数量不到其0.005%。其强大的可扩展性、通过logit访问与某些闭源模型的兼容性,以及与传统奖励模型结合以获得额外性能提升的能力,突显了SWIFT的实用价值及其对更高效数据驱动LLM后训练的贡献。我们的代码可在https://github.com/aster2024/SWIFT获取。
引用
@article{arxiv.2505.12225,
title = {Mining Intrinsic Rewards from LLM Hidden States for Efficient Best-of-N Sampling},
author = {Jizhou Guo and Zhaomin Wu and Hanchen Yang and Philip S. Yu},
journal= {arXiv preprint arXiv:2505.12225},
year = {2026}
}
备注
Accepted by KDD 2026 (Research Track). Project page: https://aster2024.github.io/swift-website/