中文

关于插值专家与多臂老虎机

机器学习 2023-08-07 v2 数据结构与算法 机器学习

摘要

带专家建议的学习与多臂老虎机是两个经典的在线决策问题,其区别在于每轮游戏中信息的观测方式。我们研究介于二者之间的一类问题。对于向量 m=(m1,,mK)NK\mathbf{m}=(m_1,\dots,m_K)\in \mathbb{N}^K,一个 m\mathbf{m}-MAB 实例表示将臂划分为 KK 组,第 ii 组包含 mim_i 个臂。一旦拉动某个臂,则同组内所有臂的损失都被观测到。我们证明了 m\mathbf{m}-MAB 的紧极小极大后悔界,并为其纯探索版本 m\mathbf{m}-BAI 设计了最优 PAC 算法,其目标是以尽可能少的轮数识别出损失最小的臂。我们证明 m\mathbf{m}-MAB 的极小极大后悔为 Θ(Tk=1Klog(mk+1))\Theta\left(\sqrt{T\sum_{k=1}^K\log (m_k+1)}\right)m\mathbf{m}-BAI 的 (ϵ,0.05)(\epsilon,0.05)-PAC 算法的最小拉动次数为 Θ(1ϵ2k=1Klog(mk+1))\Theta\left(\frac{1}{\epsilon^2}\cdot \sum_{k=1}^K\log (m_k+1)\right)。我们对 m\mathbf{m}-MAB 的上下界均可推广到更一般的情形,即图反馈老虎机,用 clique cover 及相关图参数表示。作为推论,我们获得了若干反馈图族的紧极小极大后悔界。

关键词

引用

@article{arxiv.2307.07264,
  title  = {On Interpolating Experts and Multi-Armed Bandits},
  author = {Houshuang Chen and Yuchen He and Chihao Zhang},
  journal= {arXiv preprint arXiv:2307.07264},
  year   = {2023}
}