中文

从以数据为中心的视角看上下文赌博机中离屏策略评估(奖励建模)何时有用?

机器学习 2024-10-30 v2 人工智能

摘要

仅利用日志数据集评估假设目标策略的价值十分重要但充满挑战。一方面,它在临床指南等高风险场景下为安全策略改进带来机遇。另一方面,此类机遇提升了对精确离屏策略评估(OPE)的需求。先前关于 OPE 的工作聚焦于改进价值估计中的算法,而本工作强调离线数据集的重要性,从而提出一个用于评估 OPE 问题的以数据为中心的框架。我们提出 DataCOPE,一个用于评估 OPE 的以数据为中心的框架,其回答了在给定数据集下我们能否以及在多大程度上可以评估目标策略的问题。DataCOPE(1)在无法访问环境的情况下预测 OPE 算法的整体性能,这在真实世界部署前(此时评估 OPE 是不可能的)尤为有用;(2)识别数据集中 OPE 可能不准确的子组;(3)允许对 OPE 问题的数据集或数据收集策略进行评估。我们使用医疗数据集在日志上下文赌博机设置下对 DataCOPE 的实证分析证实了其评估机器学习及人类专家策略(如临床指南)的能力。最后,我们将 DataCOPE 应用于大语言模型对齐中的奖励建模任务,以展示其在真实世界应用中的可扩展性。

关键词

引用

@article{arxiv.2311.14110,
  title  = {When is Off-Policy Evaluation (Reward Modeling) Useful in Contextual Bandits? A Data-Centric Perspective},
  author = {Hao Sun and Alex J. Chan and Nabeel Seedat and Alihan Hüyük and Mihaela van der Schaar},
  journal= {arXiv preprint arXiv:2311.14110},
  year   = {2024}
}

备注

Reward Modeling, Large Language Models, RLHF, Off-Policy Evaluation, Data-Centric AI, Data-Centric Reinforcement Learning, Reinforcement Learning