存在新动作情形下的离线上下文Bandit
机器学习
2026-05-19 v1
摘要
自动决策算法驱动着推荐系统和搜索引擎等应用。这些算法通常依赖于离线策略上下文bandit或离线策略学习(OPL)。传统上,OPL从现有动作集中选择能最大化期望奖励的动作。然而,在许多现实场景中,动作(如新闻文章或视频内容)不断变化,动作空间在数据收集后随时间演化。我们将部署日志策略后引入的动作定义为新动作,并重点关注带有新动作的OPL。现有的OPL方法能有效地从现有动作集中识别最优动作,但由于没有记录相关数据,无法学习和选择新动作。为解决这一局限性,我们提出了一种利用动作特征的OPL新方法。我们首先引入用于策略梯度的局部组合伪逆(LCPI)估计器,推广了最初为slate bandit的离线策略评估提出的伪逆估计器。LCPI控制奖励建模条件与关于动作特征的数据收集条件之间的权衡,捕捉动作特征不同维度间的交互效应。此外,我们提出了一种称为有效新动作策略优化(PONA)的广义算法,该算法将专用于新动作选择的LCPI与擅长在现有动作中学习的双稳健(DR)相结合。我们将PONA定义为LCPI和DR估计器的加权和,同时优化现有动作和新动作的选择,并允许通过权重参数调整新动作选择的比例。通过大量实验,我们证明PONA能高效选择新动作,同时保持整体策略性能,而大多数现有方法无法选择新动作。
引用
@article{arxiv.2605.18509,
title = {Offline Contextual Bandits in the Presence of New Actions},
author = {Ren Kishimoto and Tatsuhiro Shimizu and Kazuki Kawamura and Takanori Muroi and Yusuke Narita and Yuki Sasamoto and Kei Tateno and Takuma Udagawa and Yuta Saito},
journal= {arXiv preprint arXiv:2605.18509},
year = {2026}
}
备注
12pages, 7 figures