中文

面向大动作空间的贝叶斯离策略评估与学习

机器学习 2025-04-10 v2 人工智能 机器学习

摘要

在交互式系统中,动作之间通常具有相关性,这为在大动作空间中进行更高效的样本离策略评估(OPE)和学习(OPL)提供了机会。我们引入了一个统一的贝叶斯框架,通过结构化和信息丰富的先验来捕捉这些相关性。在该框架中,我们提出了 sDM,一种用于 OPE 和 OPL 的通用贝叶斯方法,其建立在算法和理论基础之上。值得注意的是,sDM 利用动作相关性而不牺牲计算效率。此外,受在线贝叶斯老虎机启发,我们引入了贝叶夫指标,用于评估算法在多个问题实例上的平均性能,偏离了传统的最坏情况评估。我们分析了 OPE 和 OPL 中的 sDM,强调了利用动作相关性的益处。实验证据展示了 sDM 的优异性能。

关键词

引用

@article{arxiv.2402.14664,
  title  = {Bayesian Off-Policy Evaluation and Learning for Large Action Spaces},
  author = {Imad Aouali and Victor-Emmanuel Brunel and David Rohde and Anna Korba},
  journal= {arXiv preprint arXiv:2402.14664},
  year   = {2025}
}

备注

Accepted at AISTATS 2025