Open Bandit 数据集与流水线:迈向真实且可复现的离策略评估
机器学习
2021-10-27 v5 机器学习
摘要
离策略评估(OPE)旨在利用由不同策略生成的数据来估计假设策略的性能。由于其在实践中巨大的潜在影响,该领域的研究兴趣日益增长。然而,目前没有真实世界的公开数据集能够用于 OPE 的评估,使其实验研究不真实且不可复现。以实现真实且可复现的 OPE 研究为目标,我们提出了 Open Bandit Dataset,一个在大型时尚电子商务平台 ZOZOTOWN 上收集的公共日志 bandit 数据集。我们的数据集的独特之处在于,它包含在相同平台上运行不同策略所收集的一组多个日志 bandit 数据集。这使得首次能够对不同的 OPE 估计量进行实验比较。我们还开发了名为 Open Bandit Pipeline 的 Python 软件,以简化并标准化批量 bandit 算法与 OPE 的实现。我们的开放数据与软件将有助于公平且透明的 OPE 研究,并帮助社区识别有价值的研究方向。我们利用我们的数据集与软件对现有 OPE 估计量进行了广泛的基准实验。结果揭示了未来 OPE 研究的关键挑战与新途径。
引用
@article{arxiv.2008.07146,
title = {Open Bandit Dataset and Pipeline: Towards Realistic and Reproducible Off-Policy Evaluation},
author = {Yuta Saito and Shunsuke Aihara and Megumi Matsutani and Yusuke Narita},
journal= {arXiv preprint arXiv:2008.07146},
year = {2021}
}
备注
Accepted at NeurIPS2021 Datasets and Benchmarks Track