中文

基于统计反馈的强化学习:从AB测试到ANT测试的历程

机器学习 2023-11-28 v1 统计理论 统计方法学 统计理论

摘要

基于人类反馈的强化学习(RLHF)在ChatGPT等大型模型的成功中发挥了关键作用。RLHF是一种结合人类反馈以提升学习效果与性能的强化学习框架。然而,在商业应用中人工获取偏好反馈极为昂贵。一些统计商业指标通常更具价值,且在RLHF中总被忽视。商业目标与模型训练之间存在鸿沟。在我们的研究中,我们将尝试以统计业务反馈替代人类反馈,使用成熟的统计方法AB测试来填补此鸿沟。提出了基于AB测试的统计反馈强化学习(RLSF)。利用统计推断方法获取偏好以训练奖励网络,该网络在强化学习框架中微调预训练模型,实现更大的商业价值。此外,我们将单时间点的双重选择AB测试扩展为不同反馈时间点的多重选择ANT测试。并且,我们设计了数值实验来验证算法框架的有效性。

关键词

引用

@article{arxiv.2311.14766,
  title  = {Reinforcement Learning from Statistical Feedback: the Journey from AB Testing to ANT Testing},
  author = {Feiyang Han and Yimin Wei and Zhaofeng Liu and Yanxing Qi},
  journal= {arXiv preprint arXiv:2311.14766},
  year   = {2023}
}