核化优势估计:从非参数统计到LLM推理
机器学习
2026-05-19 v2 机器学习
摘要
大型语言模型的最新进展日益依赖强化学习来提升其推理能力。三种方法已被广泛采用:第一种依赖深度神经网络来估计学习策略的价值函数,以降低策略梯度的方差。然而,估计和维护这样一个价值网络会带来大量的计算和内存开销。第二种通过使用样本平均值来近似价值函数,从而避免训练价值网络。然而,它为每个提示采样大量推理轨迹以进行准确的价值函数近似,这使得计算成本高昂。第三种每个提示仅采样单个推理轨迹,这降低了计算成本,但样本效率低下。本文关注一个实际的、资源受限的设置,其中每个提示只能采样少量推理轨迹,而低方差梯度估计对于高质量的策略学习仍然至关重要。为应对这一挑战,我们将经典的非参数统计方法(兼具计算和统计效率)引入LLM推理。我们采用核平滑作为价值函数估计及后续策略优化的具体实例。数值和理论结果表明,我们的方案实现了准确的价值和梯度估计,从而改进了策略优化。
引用
@article{arxiv.2604.28005,
title = {Kernelized Advantage Estimation: From Nonparametric Statistics to LLM Reasoning},
author = {Shijin Gong and Kai Ye and Jin Zhu and Xinyu Zhang and Hongyi Zhou and Chengchun Shi},
journal= {arXiv preprint arXiv:2604.28005},
year = {2026}
}
备注
45 pages, 5 figures