中文

用于离屏评估与策略优化的极小极大值区间

机器学习 2020-11-06 v6 最优化与控制 机器学习

摘要

我们研究利用值函数与边缘化重要性权重的离屏评估 (OPE) 极小极大方法。尽管它们有望克服传统重要性采样中的指数级方差,若干关键问题仍然存在:(1) 它们需要函数近似且一般有偏。为可信 OPE 起见,是否有办法量化这些偏差?(2) 它们分为两种风格(“权重学习” vs “值学习”)。我们能否统一它们?本文对两个问题均给出肯定回答。通过略微改动先前方法(每种风格各一;Uehara et al., 2020)的推导,我们将它们统一为一个单一的值区间,其带有一种特殊类型的双重鲁棒性:当值函数或重要性权重类之一设定良好时,该区间有效且其长度量化了另一类的设定错误。我们的区间也提供了对若干近期方法的统一视角与新见解,并进一步探索了我们的结果在覆盖不足数据下离屏策略优化中探索与利用的含义。

关键词

引用

@article{arxiv.2002.02081,
  title  = {Minimax Value Interval for Off-Policy Evaluation and Policy Optimization},
  author = {Nan Jiang and Jiawei Huang},
  journal= {arXiv preprint arXiv:2002.02081},
  year   = {2020}
}