基于策略卷积的大动作空间离策略评估
机器学习
2023-10-25 v1 信息检索
摘要
开发准确的离策略估计器对于评估和优化新策略至关重要。离策略估计的主要挑战在于生成数据的记录策略与我们要评估的目标策略之间存在分布偏移。通常,纠正分布偏移的技术涉及某种形式的重要性采样。这种方法能产生无偏的价值估计,但往往以高方差为代价,即使在更简单的一步上下文赌机情形下也是如此。此外,重要性采样依赖于共同支撑假设,当动作空间很大时,该假设变得不切实际。为了应对这些挑战,我们引入了策略卷积(PC)估计器族。这些方法利用动作内的潜在结构——通过动作嵌入获得——来策略性地卷积记录策略和目标策略。这种卷积引入了一种独特的偏差-方差权衡,可以通过调整卷积量来控制。我们在合成数据集和基准数据集上的实验表明,使用 PC 在均方误差(MSE)上取得了显著改善,特别是当动作空间或策略不匹配变大时,与现有估计器相比,增益高达 5 到 6 个数量级。
引用
@article{arxiv.2310.15433,
title = {Off-Policy Evaluation for Large Action Spaces via Policy Convolution},
author = {Noveen Sachdeva and Lequn Wang and Dawen Liang and Nathan Kallus and Julian McAuley},
journal= {arXiv preprint arXiv:2310.15433},
year = {2023}
}
备注
Under review. 36 pages, 31 figures