中文

BanditQ:具有收益保证的公平赌博机

机器学习 2024-05-14 v3 性能

摘要

经典的无悔多臂赌博机算法,包括上置信界(UCB)、Hedge 和 EXP3,在设计上 inherently 不公平。其不公平性源于其目标:尽可能频繁地拉动收益最高的臂而忽略其余臂。在本文中,我们考虑随机设定下的公平预测问题,其中每臂具有保证的最小收益累积速率。我们在全信息及赌博机反馈两种设定下研究该问题。结合排队论技术与对抗赌博机,我们提出一种名为 BanditQ 的新在线策略,其在实现目标收益速率的同时,将后悔值与目标速率违背惩罚控制在至多 O(T34)O(T^{\frac{3}{4}})。在全信息设定下,在单调性假设下或考虑时间平均后悔时,后悔界可进一步改进至 O(T)O(\sqrt{T})。所提策略高效,并实现了从公平预测问题到标准对抗多臂赌博机(MAB)问题的黑盒归约。BanditQ 策略的分析涉及一种新的自界不等式,其本身可能具有独立意义。

关键词

引用

@article{arxiv.2304.05219,
  title  = {BanditQ: Fair Bandits with Guaranteed Rewards},
  author = {Abhishek Sinha},
  journal= {arXiv preprint arXiv:2304.05219},
  year   = {2024}
}

备注

To appear in the 40th Conference on Uncertainty in Artificial Intelligence (UAI 2024), Barcelona, Spain