中文

上下文赌博机问题中从人类偏好进行策略学习的可证明收益

机器学习 2023-10-31 v2 统计理论 机器学习 统计理论

摘要

对于真实的决策问题,奖励函数往往需要被设计或学习。一种流行的方法是利用人类反馈来学习用于训练的奖励函数。最直接的方式是要求人类在绝对尺度上对状态-动作对提供评分,并将这些评分直接作为奖励样本。另一种流行方式是要求人类按偏好对一小组状态-动作对排序,并从这些偏好数据中学习奖励函数。近来,基于偏好的方法在如 InstructGPT 等实证应用中展现了显著成功。在本工作中,我们在离线上下文赌博机中对这些人反馈方法进行了理论比较,并展示了反馈建模中的人类偏差与不确定性如何影响这些方法的理论保证。借此,我们的结果力求从建模视角为基于偏好方法的实证成功提供理论解释。

关键词

引用

@article{arxiv.2307.12975,
  title  = {Provable Benefits of Policy Learning from Human Preferences in Contextual Bandit Problems},
  author = {Xiang Ji and Huazheng Wang and Minshuo Chen and Tuo Zhao and Mengdi Wang},
  journal= {arXiv preprint arXiv:2307.12975},
  year   = {2023}
}