用于离屏策略策略评估的表示平衡 MDP
机器学习
2019-04-19 v4 人工智能
机器学习
摘要
我们研究强化学习(RL)中的离屏策略评估(OPPE)问题。与先前工作不同,我们考虑如何同时准确估计个体策略值与平均策略值。我们从因果推理的近期工作中获得启发,提出了基于 MDP 模型的值估计的新有限样本泛化误差界。使用该上界作为目标,我们开发了具有平衡表示的 MDP 模型学习算法,并表明我们的方法在常见合成基准和 HIV 治疗模拟领域中能显著降低均方误差(MSE)。
引用
@article{arxiv.1805.09044,
title = {Representation Balancing MDPs for Off-Policy Policy Evaluation},
author = {Yao Liu and Omer Gottesman and Aniruddh Raghu and Matthieu Komorowski and Aldo Faisal and Finale Doshi-Velez and Emma Brunskill},
journal= {arXiv preprint arXiv:1805.09044},
year = {2019}
}
备注
appeared at NeurIPS 18; updated style file