中文

OPERA:基于重加权多个估计器的自动离线策略评估

机器学习 2024-11-04 v2 人工智能 机器学习

摘要

离线策略评估(OPE)允许我们通过利用来自其他策略收集的历史交互数据来评估和估计新的序列决策策略的性能。在教育和医疗等领域,若无可靠估计即可在线评估新策略,可能导致成本高昂、不安全或危险的结果。过去十年提出了许多 OPE 估计器,许多需要调参并要求训练。不幸的是,针对每个任务和领域选择最佳 OPE 算法仍不清晰。本文提出一种新算法,通过自适应混合给定数据集中的多个 OPE 估计器,而无需依赖显式选择的统计程序。我们证明了该估计器是一致的,并满足策略评估的若干理想属性。此外,我们展示在与替代方法相比时,本估计器可用于在医疗和机器人领域选择表现更好的策略。我们的工作有助于提高通用、无模型依赖、离线策略评估框架的易用性。

关键词

引用

@article{arxiv.2405.17708,
  title  = {OPERA: Automatic Offline Policy Evaluation with Re-weighted Aggregates of Multiple Estimators},
  author = {Allen Nie and Yash Chandak and Christina J. Yuan and Anirudhan Badrinath and Yannis Flet-Berliac and Emma Brunskil},
  journal= {arXiv preprint arXiv:2405.17708},
  year   = {2024}
}

备注

22 pages