关于插值专家与多臂老虎机
机器学习
2023-08-07 v2 数据结构与算法
机器学习
摘要
带专家建议的学习与多臂老虎机是两个经典的在线决策问题,其区别在于每轮游戏中信息的观测方式。我们研究介于二者之间的一类问题。对于向量 ,一个 -MAB 实例表示将臂划分为 组,第 组包含 个臂。一旦拉动某个臂,则同组内所有臂的损失都被观测到。我们证明了 -MAB 的紧极小极大后悔界,并为其纯探索版本 -BAI 设计了最优 PAC 算法,其目标是以尽可能少的轮数识别出损失最小的臂。我们证明 -MAB 的极小极大后悔为 ,-BAI 的 -PAC 算法的最小拉动次数为 。我们对 -MAB 的上下界均可推广到更一般的情形,即图反馈老虎机,用 clique cover 及相关图参数表示。作为推论,我们获得了若干反馈图族的紧极小极大后悔界。
引用
@article{arxiv.2307.07264,
title = {On Interpolating Experts and Multi-Armed Bandits},
author = {Houshuang Chen and Yuchen He and Chihao Zhang},
journal= {arXiv preprint arXiv:2307.07264},
year = {2023}
}