中介反馈赌博机的信息容量遗憾界
机器学习
2024-02-19 v1 机器学习
摘要
本文研究了中介反馈问题,这是一种赌博机博弈,其中决策集由多个策略组成,每个策略关联一个在共同结果空间上的概率分布。选择策略后,学习器观察从其分布中采样的结果,并承担当前轮次中分配给该结果的损失。我们引入策略集容量作为策略集复杂度的信息论度量。采用经典的EXP4算法,我们在对抗性和随机性设定下提供了依赖于策略集容量的新遗憾界。对于一组策略集族,我们证明了几乎匹配的下界,其缩放与容量类似。我们还考虑了策略分布可以在轮次之间变化的情况,从而解决了相关的带专家建议的赌博机问题,并改进了先前的结果。此外,我们证明了一个下界,表明在线性赌博机反馈下,通常不可能利用策略之间的相似性。最后,对于完全信息变体,我们提供了一个遗憾界,其缩放与策略集的信息半径有关。
引用
@article{arxiv.2402.10282,
title = {Information Capacity Regret Bounds for Bandits with Mediator Feedback},
author = {Khaled Eldowa and Nicolò Cesa-Bianchi and Alberto Maria Metelli and Marcello Restelli},
journal= {arXiv preprint arXiv:2402.10282},
year = {2024}
}