中文

在线 KL 正则化强化学习的对数遗憾

机器学习 2026-03-12 v6 机器学习

摘要

来自人类反馈的强化学习(RLHF)的最新进展表明,KL 正则化在提升大型语言模型(LLM)的 RL 微调效率方面发挥着关键作用。尽管具有经验优势,但 KL 正则化 RL 与标准 RL 之间的理论差异在很大程度上仍未被充分探索。虽然近期已有针对决策中 KL 正则化目标的理论分析工作 \citep{xiong2024iterative, xie2024exploratory,zhao2024sharp},但这些分析要么归约为传统 RL 设置,要么依赖强覆盖假设。本文提出一种基于乐观主义的 KL 正则化在线上下文 bandit 算法,并给出了其遗憾的新颖分析。通过充分利用 KL 正则化所诱导的良好优化景观和乐观奖励估计,我们的算法实现了 O(ηlog(NRT)dR)\mathcal{O}\big(\eta\log (N_{\mathcal R} T)\cdot d_{\mathcal R}\big) 的对数遗憾上界,其中 η,NR,T,dR\eta, N_{\mathcal R},T,d_{\mathcal R} 分别表示 KL 正则化参数、奖励函数类的基数、轮数和奖励函数类的复杂度。此外,我们通过开发一种新颖的转移步分解,将算法和分析扩展到强化学习,并获得了类似的对数遗憾上界。

关键词

引用

@article{arxiv.2502.07460,
  title  = {Logarithmic Regret for Online KL-Regularized Reinforcement Learning},
  author = {Heyang Zhao and Chenlu Ye and Wei Xiong and Quanquan Gu and Tong Zhang},
  journal= {arXiv preprint arXiv:2502.07460},
  year   = {2026}
}