POTEC:通过两阶段策略分解的大动作空间离策学习
机器学习
2024-02-12 v1 机器学习
摘要
我们研究了大离散动作空间中上下文多臂老虎机策略的离策学习(OPL),现有方法(大多严重依赖奖励回归模型或重要性加权策略梯度)因偏差或方差过大而失效。为克服 OPL 中的这些问题,我们提出了一种名为“通过两阶段策略分解的策略优化”(POTEC)的新型两阶段算法。它利用动作空间中的聚类,并分别通过基于策略和基于回归的方法学习两种不同的策略。具体而言,我们推导了一种新颖的低方差梯度估计器,使得能够通过基于策略的方法高效地学习用于聚类选择的第一阶段策略。为了在第一阶段策略采样的聚类内选择特定动作,POTEC 使用在每个聚类内基于回归方法导出的第二阶段策略。我们表明,局部正确性条件(仅要求回归模型保留每个聚类内动作的相对期望奖励差异)确保了我们的策略梯度估计器是无偏的,且第二阶段策略是最优的。我们还表明,POTEC 提供了基于策略和基于回归的方法及其相关假设的严格泛化。综合实验表明,POTEC 在 OPL 有效性方面提供了显著改进,特别是在大型且结构化的动作空间中。
引用
@article{arxiv.2402.06151,
title = {POTEC: Off-Policy Learning for Large Action Spaces via Two-Stage Policy Decomposition},
author = {Yuta Saito and Jihan Yao and Thorsten Joachims},
journal= {arXiv preprint arXiv:2402.06151},
year = {2024}
}
备注
arXiv admin note: text overlap with arXiv:2305.08062