具有因果相关收益的分段平稳组合半带臂问题
机器学习
2023-07-27 v1 人工智能
机器学习
摘要
我们研究具有因果相关收益的分段平稳组合半带臂问题。在非平稳环境中,基础臂分布、收益间因果关系或两者的变化都会改变收益生成过程。在此类环境中,最优决策者必须追踪两类变化来源并相应适应。在组合半带臂设定下问题愈发严峻,因为决策者仅能观测所选臂束的结果。我们提出策略的核心为置信上界(UCB)算法。我们假设智能体依赖自适应方法来克服挑战。更具体地,其采用基于广义似然比(GLR)检验的变点检测器。此外,我们引入组重启概念,作为结构化环境决策过程中重启策略的新替代方案。最后,我们的算法集成了追踪底层图结构变化的机制,该图捕捉了带臂设定中收益间的因果关系。理论上,我们建立了反映结构变化与分布变化次数对性能影响的后悔上界。我们在真实场景中的数值实验结果表明,与最先进的基准相比,所提方法具有适用性与优越性能。
引用
@article{arxiv.2307.14138,
title = {Piecewise-Stationary Combinatorial Semi-Bandit with Causally Related Rewards},
author = {Behzad Nourani-Koliji and Steven Bilaj and Amir Rezaei Balef and Setareh Maghsudi},
journal= {arXiv preprint arXiv:2307.14138},
year = {2023}
}