中文

面向离屏策略评估风险-收益权衡的评估与基准测试

机器学习 2024-03-12 v3 人工智能

摘要

离屏策略评估(OPE)旨在仅利用离线日志数据评估反事实策略的有效性,并常用于在在线 A/B 测试中筛选待部署的 top-k 有前景策略。现有 OPE 估计量的评估指标主要关注 OPE 或其下游策略选择的“准确性”,忽视了后续在线策略部署中的风险-收益权衡。为解决此问题,我们借鉴金融中的组合评估,提出一种称为 SharpeRatio@k 的新指标,用以衡量在不同在线评估预算(k)下由某 OPE 估计量构成的策略组合的风险-收益权衡。我们在两个示例场景中验证该指标,证明其能有效区分低风险与高风险估计量并准确识别最高效者。估计量的高效性体现于其构成最有利策略组合的能力,即在在线部署中最大化收益同时最小化风险,这一细微差别常被现有指标忽略。为借助 SharpeRatio@k 实现快速、准确且一致的 OPE 评估,我们将该指标集成入开源软件 SCOPE-RL(https://github.com/hakuhodo-technologies/scope-rl)。利用 SharpeRatio@k 与 SCOPE-RL,我们对多种估计量与 RL 任务开展了聚焦风险-收益权衡的综合性基准实验,为未来 OPE 研究提供了若干有趣方向和建议。

关键词

引用

@article{arxiv.2311.18207,
  title  = {Towards Assessing and Benchmarking Risk-Return Tradeoff of Off-Policy Evaluation},
  author = {Haruka Kiyohara and Ren Kishimoto and Kosuke Kawakami and Ken Kobayashi and Kazuhide Nakata and Yuta Saito},
  journal= {arXiv preprint arXiv:2311.18207},
  year   = {2024}
}

备注

ICLR2024