具有自信息奖励的多臂老虎机
信息论
2022-09-07 v1 机器学习
math.IT
摘要
本文引入信息多臂老虎机(IMAB)模型,其中每轮玩家选择一条臂,观测一个符号,并以该符号的自信息形式获得未观测的奖励。因此,一条臂的期望奖励是生成其符号的信源概率质量函数的香农熵。玩家旨在最大化与所玩臂的熵值相关的期望总奖励。在字母表大小已知的假设下,针对 IMAB 模型提出了两种基于 UCB 的算法,它们考虑了插件熵估计器的偏差。第一种算法乐观地修正熵估计中的偏差项。第二种算法依赖于适应小熵值信源的数据相关置信区间。通过上界限定每种算法的期望后悔值提供了性能保证。此外,在伯努利情形下,将这些算法的渐近行为与伪后悔的 Lai-Robbins 下界进行比较。另外,在精确字母表大小未知、玩家仅知其宽松上界的假设下,提出了一种基于 UCB 的算法,其中玩家旨在有限时间区间内减少由未知字母表大小引起的后悔。文中给出了展示所提算法期望后悔值的数值结果。
引用
@article{arxiv.2209.02211,
title = {Multi-Armed Bandits with Self-Information Rewards},
author = {Nir Weinberger and Michal Yemini},
journal= {arXiv preprint arXiv:2209.02211},
year = {2022}
}