通用动作空间中的平衡离屏策略评估
机器学习
2020-03-06 v4 统计方法学
机器学习
摘要
在上下文_bandit 的离屏策略评估中,重要性采样权重的估计常导致失衡——即加权后状态-动作对的实际分布与期望分布不匹配。本文提出平衡离屏策略评估(B-OPE),一种估计权重以最小化该失衡的通用方法。无论动作类型如何,这些权重的估计均可归约为一个二分类问题。我们证明,最小化分类器风险即意味着向期望的反事实状态-动作对分布最小化失衡。分类器损失与离屏策略估计的误差相关联,从而便于超参数调优。我们提供了实验证据,表明 B-OPE 在离散与连续动作空间中均改进了基于加权的离线策略评估方法。
引用
@article{arxiv.1906.03694,
title = {Balanced off-policy evaluation in general action spaces},
author = {Arjun Sondhi and David Arbour and Drew Dimmery},
journal= {arXiv preprint arXiv:1906.03694},
year = {2020}
}
备注
Accepted to AISTATS 2020