上下文 bandit 中策略外评估的上下文-动作嵌入学习
机器学习
2025-10-15 v2 机器学习
摘要
我们考虑有限动作空间中的上下文 bandit 的策略外评估(OPE)。逆倾向得分(IPS)加权是 OPE 中广泛使用的方法,因其无偏性而受到青睐,但当动作空间较大或上下文-动作空间的某些部分探索不足时,它会受到显著方差的影响。近期提出的边际化 IPS(MIPS)估计量通过利用动作嵌入来缓解此问题。然而,这些嵌入并未最小化估计量的均方误差(MSE),也未考虑上下文信息。为解决这些局限性,我们引入了用于 MIPS 的上下文-动作嵌入学习(CAEL-MIPS),该方法从离线数据中学习上下文-动作嵌入以最小化 MIPS 估计量的 MSE。基于 MIPS 偏差和方差的理论分析,我们为 CAEL-MIPS 提出了一个最小化 MSE 的目标函数。在合成数据集和真实数据集上的实证研究表明,我们的估计量在 MSE 方面优于基线方法。
引用
@article{arxiv.2509.00648,
title = {Context-Action Embedding Learning for Off-Policy Evaluation in Contextual Bandits},
author = {Kushagra Chandak and Vincent Liu and Haanvid Lee},
journal= {arXiv preprint arXiv:2509.00648},
year = {2025}
}