中文

非平稳Bandit学习的信息论分析

机器学习 2023-12-27 v2 信息论 math.IT

摘要

在非平稳bandit学习问题中,决策者在环境潜在状态演变时必须持续收集信息并调整其动作选择。在每一时期,某个潜在最优动作在环境状态下使期望奖励最大化。我们将最优动作序列视为随机过程,并采用信息论方法来分析可获得的性能。我们根据最优动作过程的熵率界定了极限每期遗憾。该界适用于文献中研究的广泛问题,并通过其信息比反映问题的信息结构。

关键词

引用

@article{arxiv.2302.04452,
  title  = {An Information-Theoretic Analysis of Nonstationary Bandit Learning},
  author = {Seungki Min and Daniel Russo},
  journal= {arXiv preprint arXiv:2302.04452},
  year   = {2023}
}