具有自适应上下文的因果情境 bandits
机器学习
2024-06-04 v2 人工智能
摘要
我们研究了一种因果情境 bandits 的变体,其中情境是根据学习者选择的初始干预而决定的。在每一轮开始时,学习者选择一个初始动作,根据该动作,环境会随机揭示情境。随后,学习者选择最终的动作并获得奖励。在 轮与环境的交互后,学习者的目标是学习一个最大化预期奖励的策略(即选择初始动作和最终动作)。本文研究了每种动作对应于对已知因果图中某个节点的干预的特定情况。我们将先前工作从确定性情境设置推广到获得简单 regret 的保证。这通过一种实例相关的因果参数 实现,后者刻画了我们的上界。此外,我们证明了我们的简单 regret 对大类实例几乎是紧致的。我们工作的一个关键特点是使用凸优化来解决 bandits 的探索问题。我们还进行实验以验证理论结果,并在项目 GitHub 仓库 https://github.com/adaptiveContextualCausalBandits/aCCB 提供代码。
关键词
引用
@article{arxiv.2405.18626,
title = {Causal Contextual Bandits with Adaptive Context},
author = {Rahul Madhavan and Aurghya Maiti and Gaurav Sinha and Siddharth Barman},
journal= {arXiv preprint arXiv:2405.18626},
year = {2024}
}
备注
Reinforcement Learning Conference (RLC) 2024, 10 pages (31 pages including appendix), 8 plots. arXiv admin note: text overlap with arXiv:2111.00886