中文

关于深度离线策略评估中的工具变量回归

机器学习 2022-12-01 v2 机器学习

摘要

我们指出,通过最小化均方 Bellman 误差来估计状态-动作值(Q 函数)这一流行的强化学习(RL)策略会导致一个存在混杂的回归问题,即输入与输出噪声相关。因此,直接最小化 Bellman 误差会导致显著有偏的 Q 函数估计。我们解释了为何在 Deep Q-Networks 与 Fitted Q Evaluation 中固定目标 Q 网络提供了一种克服此混杂的方法,从而对这一深度 RL 文献中流行但未被充分理解的技巧给出了新的见解。解决混杂的另一种方法是利用因果文献中发展的技术,特别是工具变量(IV)。我们在此将 IV 与 RL 文献结合,研究 IV 方法是否能带来改进的 Q 函数估计。本文在离线策略评估(OPE)背景下分析并比较了多种近期 IV 方法,其目标仅是利用日志数据估计策略的值。通过将不同 IV 技术应用于 OPE,我们不仅能恢复先前提出的 OPE 方法(如基于模型的技术),还能获得有竞争力的新技术。我们通过实验发现,最优 OPE 方法的性能与某些并非为 OPE 开发的 IV 方法(如 AGMM) closely matched。我们在 https://github.com/liyuan9988/IVOPEwithACME 开源了所有代码与数据集。

关键词

引用

@article{arxiv.2105.10148,
  title  = {On Instrumental Variable Regression for Deep Offline Policy Evaluation},
  author = {Yutian Chen and Liyuan Xu and Caglar Gulcehre and Tom Le Paine and Arthur Gretton and Nando de Freitas and Arnaud Doucet},
  journal= {arXiv preprint arXiv:2105.10148},
  year   = {2022}
}

备注

Accepted by Journal of Machine Learning Research in 11/2022