基于统计反馈的强化学习:从AB测试到ANT测试的历程
机器学习
2023-11-28 v1 统计理论
统计方法学
统计理论
摘要
基于人类反馈的强化学习(RLHF)在ChatGPT等大型模型的成功中发挥了关键作用。RLHF是一种结合人类反馈以提升学习效果与性能的强化学习框架。然而,在商业应用中人工获取偏好反馈极为昂贵。一些统计商业指标通常更具价值,且在RLHF中总被忽视。商业目标与模型训练之间存在鸿沟。在我们的研究中,我们将尝试以统计业务反馈替代人类反馈,使用成熟的统计方法AB测试来填补此鸿沟。提出了基于AB测试的统计反馈强化学习(RLSF)。利用统计推断方法获取偏好以训练奖励网络,该网络在强化学习框架中微调预训练模型,实现更大的商业价值。此外,我们将单时间点的双重选择AB测试扩展为不同反馈时间点的多重选择ANT测试。并且,我们设计了数值实验来验证算法框架的有效性。
引用
@article{arxiv.2311.14766,
title = {Reinforcement Learning from Statistical Feedback: the Journey from AB Testing to ANT Testing},
author = {Feiyang Han and Yimin Wei and Zhaofeng Liu and Yanxing Qi},
journal= {arXiv preprint arXiv:2311.14766},
year = {2023}
}