中文

具有小规模最优臂集合的非平稳_bandit_与元学习

机器学习 2022-10-20 v6 机器学习

摘要

我们研究一个序列决策问题,其中学习器面对一系列 KK-臂 bandit 任务。任务边界可能是已知的(bandit 元学习设定),也可能是未知的(非平稳 bandit 设定)。对于给定的整数 MKM\le K,学习器的目标是与大小为 MM 的最优臂子集竞争。我们设计了一种基于归约到 bandit 子模最大化的算法,并表明,对于由 NN 个任务组成的 TT 轮,在任务数大且最优臂数 MM 小的情形下,其在两种设定中的后悔均小于可通过使用为标准非平稳 bandit 问题设计的算法获得的简单基线 O~(KNT)\tilde{O}(\sqrt{KNT})。对于任务长度 τ\tau 固定的 bandit 元学习问题,我们表明该算法的后悔界为 O~(NMMτ+N2/3Mτ)\tilde{O}(NM\sqrt{M \tau}+N^{2/3}M\tau)。在对每个任务中最优臂的可识别性附加假设下,我们给出了一种后悔改进为 O~(NMτ+N1/2MKτ)\tilde{O}(N\sqrt{M \tau}+N^{1/2}\sqrt{M K \tau}) 的 bandit 元学习算法。

关键词

引用

@article{arxiv.2202.13001,
  title  = {Non-stationary Bandits and Meta-Learning with a Small Set of Optimal Arms},
  author = {MohammadJavad Azizi and Thang Duong and Yasin Abbasi-Yadkori and András György and Claire Vernade and Mohammad Ghavamzadeh},
  journal= {arXiv preprint arXiv:2202.13001},
  year   = {2022}
}