面向离屏策略评估风险-收益权衡的评估与基准测试
机器学习
2024-03-12 v3 人工智能
摘要
离屏策略评估(OPE)旨在仅利用离线日志数据评估反事实策略的有效性,并常用于在在线 A/B 测试中筛选待部署的 top-k 有前景策略。现有 OPE 估计量的评估指标主要关注 OPE 或其下游策略选择的“准确性”,忽视了后续在线策略部署中的风险-收益权衡。为解决此问题,我们借鉴金融中的组合评估,提出一种称为 SharpeRatio@k 的新指标,用以衡量在不同在线评估预算(k)下由某 OPE 估计量构成的策略组合的风险-收益权衡。我们在两个示例场景中验证该指标,证明其能有效区分低风险与高风险估计量并准确识别最高效者。估计量的高效性体现于其构成最有利策略组合的能力,即在在线部署中最大化收益同时最小化风险,这一细微差别常被现有指标忽略。为借助 SharpeRatio@k 实现快速、准确且一致的 OPE 评估,我们将该指标集成入开源软件 SCOPE-RL(https://github.com/hakuhodo-technologies/scope-rl)。利用 SharpeRatio@k 与 SCOPE-RL,我们对多种估计量与 RL 任务开展了聚焦风险-收益权衡的综合性基准实验,为未来 OPE 研究提供了若干有趣方向和建议。
引用
@article{arxiv.2311.18207,
title = {Towards Assessing and Benchmarking Risk-Return Tradeoff of Off-Policy Evaluation},
author = {Haruka Kiyohara and Ren Kishimoto and Kosuke Kawakami and Ken Kobayashi and Kazuhide Nakata and Yuta Saito},
journal= {arXiv preprint arXiv:2311.18207},
year = {2024}
}
备注
ICLR2024