面向大动作空间的贝叶斯离策略评估与学习
机器学习
2025-04-10 v2 人工智能
机器学习
摘要
在交互式系统中,动作之间通常具有相关性,这为在大动作空间中进行更高效的样本离策略评估(OPE)和学习(OPL)提供了机会。我们引入了一个统一的贝叶斯框架,通过结构化和信息丰富的先验来捕捉这些相关性。在该框架中,我们提出了 sDM,一种用于 OPE 和 OPL 的通用贝叶斯方法,其建立在算法和理论基础之上。值得注意的是,sDM 利用动作相关性而不牺牲计算效率。此外,受在线贝叶斯老虎机启发,我们引入了贝叶夫指标,用于评估算法在多个问题实例上的平均性能,偏离了传统的最坏情况评估。我们分析了 OPE 和 OPL 中的 sDM,强调了利用动作相关性的益处。实验证据展示了 sDM 的优异性能。
引用
@article{arxiv.2402.14664,
title = {Bayesian Off-Policy Evaluation and Learning for Large Action Spaces},
author = {Imad Aouali and Victor-Emmanuel Brunel and David Rohde and Anna Korba},
journal= {arXiv preprint arXiv:2402.14664},
year = {2025}
}
备注
Accepted at AISTATS 2025