具有预测误差保证的分布离线策略评估
机器学习
2024-01-01 v3
摘要
我们研究利用并非由目标策略生成的离线数据集来估计该策略回报分布的问题,即分布离线策略评估(OPE)。我们提出一种名为拟合似然估计(FLE)的算法,该算法执行一系列最大似然估计(MLE),并且只要任何最先进的概率生成模型能通过MLE训练,就能灵活集成。FLE可用于奖励为多维向量的有限时域和无限时域折扣设置。我们的理论结果表明,对于有限时域和无限时域折扣设置,FLE能分别学习到在全变差距离和Wasserstein距离下接近真实情况的分布。这些理论结果成立的条件是离线数据覆盖了测试策略的轨迹,且监督学习MLE过程成功。在实验中,我们使用高斯混合模型和扩散模型这两种生成模型展示了FLE的性能。对于多维奖励设置,结合扩散模型的FLE能够估计测试策略回报的复杂分布。
引用
@article{arxiv.2302.09456,
title = {Distributional Offline Policy Evaluation with Predictive Error Guarantees},
author = {Runzhe Wu and Masatoshi Uehara and Wen Sun},
journal= {arXiv preprint arXiv:2302.09456},
year = {2024}
}
备注
Accepted at ICML 2023