KL 正则化上下文 Bandits 与 RLHF 的尖锐分析
机器学习
2025-02-12 v2 机器学习
摘要
逆 Kullback-Leibler (KL) 正则化已成为增强强化学习 (RL) 和基于人类反馈的强化学习 (RLHF) 中策略优化的主要技术,迫使学习到的策略接近参考策略。虽然 KL 正则化的有效性和必要性已在各种实际场景中得到实证验证,但目前对 KL 正则化 RLHF 的理论分析仍获得与无 KL 正则化问题相同的 样本复杂度。为了理解带 KL 正则化与不带 KL 正则化的策略学习目标之间的根本区别,我们首次通过为 KL 正则化上下文 Bandits 和 RLHF 提供尖锐分析,从理论上证明了 KL 正则化的力量,揭示出当 足够小时具有 样本复杂度。我们进一步探讨了数据覆盖在上下文 Bandits 和 RLHF 中的作用。虽然覆盖假设通常用于离线 RLHF 中将参考策略的样本与最优策略关联起来,但往往以覆盖系数的乘法依赖为代价,其对在线 RLHF 样本复杂度的影响尚不清楚。之前对在线 RLHF 的理论分析通常需要显式探索和对奖励函数类的额外结构假设。相比之下,我们证明当参考策略具有足够覆盖时,一个简单的两阶段混合采样策略可以实现仅具有覆盖系数加法依赖的样本复杂度。我们的结果提供了对 KL 正则化和数据覆盖在 RLHF 中作用的全面理解,为设计更高效的 RLHF 算法提供了启示。
引用
@article{arxiv.2411.04625,
title = {Sharp Analysis for KL-Regularized Contextual Bandits and RLHF},
author = {Heyang Zhao and Chenlu Ye and Quanquan Gu and Tong Zhang},
journal= {arXiv preprint arXiv:2411.04625},
year = {2025}
}