具有因果相关奖励的非平稳延迟组合半_bandit 问题
机器学习
2023-07-19 v1 机器学习
摘要
不确定性下的序贯决策常伴随长反馈延迟。此类延迟会降低学习智能体在长期中识别具有最优集体奖励的臂子集的性能。当环境非平稳且各臂的奖励分布间存在结构依赖时,该问题极具挑战性。因此,除适应延迟与环境变化外,学习因果关系可缓解反馈延迟对决策过程的不利影响。我们将所述设定形式化为具有因果相关奖励的非平稳延迟组合半_bandit 问题。我们以平稳结构方程模型中的有向图对因果关系建模。智能体最大化长期平均收益,其定义为基臂奖励的线性函数。我们开发了一种策略,从延迟反馈中学习结构依赖并利用其优化决策,同时适应漂移。我们证明了所提算法的后悔界。此外,我们通过使用合成与真实世界数据集的数值分析评估了我们的方法,以检测意大利境内对 Covid-19 传播贡献最大的区域。
引用
@article{arxiv.2307.09093,
title = {Non-stationary Delayed Combinatorial Semi-Bandit with Causally Related Rewards},
author = {Saeed Ghoorchian and Setareh Maghsudi},
journal= {arXiv preprint arXiv:2307.09093},
year = {2023}
}
备注
33 pages, 9 figures. arXiv admin note: text overlap with arXiv:2212.12923