中文

上下文组合 Bandit 中的有效离线策略评估与学习

机器学习 2024-08-22 v1 人工智能 机器学习

摘要

我们探索上下文组合 Bandit(CCB)中的离线策略评估与学习(OPE/L),其中策略在动作空间中选择一个子集。例如,它可以从可用物品(床、抽屉、椅子等)中选择一组家具(床和抽屉)用于室内设计销售。这种设置在推荐系统和医疗保健等领域广泛存在,但 CCB 的 OPE/L 在相关文献中尚未被探索。典型的 OPE/L 方法如回归和重要性采样可应用于 CCB 问题,但它们面临高偏差或方差的显著挑战,且可用子集数量的指数增长进一步加剧了这些挑战。为应对这些挑战,我们引入了因子化动作空间的概念,使我们能够将每个子集分解为二进制指示变量。该公式使我们能够区分来自主动作的''主效应''和来自补充动作的''残差效应'',从而实现更有效的 OPE。具体而言,我们的估计器 OPCB 利用基于重要性采样的方法无偏估计主效应,同时采用基于回归的方法以低方差处理残差效应。理论分析表明,OPCB 相比传统重要性采样方法实现了显著的方差缩减,在某些条件下相比回归方法实现了偏差缩减。实验验证了 OPCB 在 OPE 和 OPL 两种任务中均优于典型方法。

关键词

引用

@article{arxiv.2408.11202,
  title  = {Effective Off-Policy Evaluation and Learning in Contextual Combinatorial Bandits},
  author = {Tatsuhiro Shimizu and Koichi Tanaka and Ren Kishimoto and Haruka Kiyohara and Masahiro Nomura and Yuta Saito},
  journal= {arXiv preprint arXiv:2408.11202},
  year   = {2024}
}

备注

accepted at RecSys2024