中文

具有自信息奖励的多臂老虎机

信息论 2022-09-07 v1 机器学习 math.IT

摘要

本文引入信息多臂老虎机(IMAB)模型,其中每轮玩家选择一条臂,观测一个符号,并以该符号的自信息形式获得未观测的奖励。因此,一条臂的期望奖励是生成其符号的信源概率质量函数的香农熵。玩家旨在最大化与所玩臂的熵值相关的期望总奖励。在字母表大小已知的假设下,针对 IMAB 模型提出了两种基于 UCB 的算法,它们考虑了插件熵估计器的偏差。第一种算法乐观地修正熵估计中的偏差项。第二种算法依赖于适应小熵值信源的数据相关置信区间。通过上界限定每种算法的期望后悔值提供了性能保证。此外,在伯努利情形下,将这些算法的渐近行为与伪后悔的 Lai-Robbins 下界进行比较。另外,在精确字母表大小未知、玩家仅知其宽松上界的假设下,提出了一种基于 UCB 的算法,其中玩家旨在有限时间区间内减少由未知字母表大小引起的后悔。文中给出了展示所提算法期望后悔值的数值结果。

关键词

引用

@article{arxiv.2209.02211,
  title  = {Multi-Armed Bandits with Self-Information Rewards},
  author = {Nir Weinberger and Michal Yemini},
  journal= {arXiv preprint arXiv:2209.02211},
  year   = {2022}
}