非平稳Bandit学习的信息论分析
机器学习
2023-12-27 v2 信息论
math.IT
摘要
在非平稳bandit学习问题中,决策者在环境潜在状态演变时必须持续收集信息并调整其动作选择。在每一时期,某个潜在最优动作在环境状态下使期望奖励最大化。我们将最优动作序列视为随机过程,并采用信息论方法来分析可获得的性能。我们根据最优动作过程的熵率界定了极限每期遗憾。该界适用于文献中研究的广泛问题,并通过其信息比反映问题的信息结构。
引用
@article{arxiv.2302.04452,
title = {An Information-Theoretic Analysis of Nonstationary Bandit Learning},
author = {Seungki Min and Daniel Russo},
journal= {arXiv preprint arXiv:2302.04452},
year = {2023}
}