具有小规模最优臂集合的非平稳_bandit_与元学习
机器学习
2022-10-20 v6 机器学习
摘要
我们研究一个序列决策问题,其中学习器面对一系列 -臂 bandit 任务。任务边界可能是已知的(bandit 元学习设定),也可能是未知的(非平稳 bandit 设定)。对于给定的整数 ,学习器的目标是与大小为 的最优臂子集竞争。我们设计了一种基于归约到 bandit 子模最大化的算法,并表明,对于由 个任务组成的 轮,在任务数大且最优臂数 小的情形下,其在两种设定中的后悔均小于可通过使用为标准非平稳 bandit 问题设计的算法获得的简单基线 。对于任务长度 固定的 bandit 元学习问题,我们表明该算法的后悔界为 。在对每个任务中最优臂的可识别性附加假设下,我们给出了一种后悔改进为 的 bandit 元学习算法。
引用
@article{arxiv.2202.13001,
title = {Non-stationary Bandits and Meta-Learning with a Small Set of Optimal Arms},
author = {MohammadJavad Azizi and Thang Duong and Yasin Abbasi-Yadkori and András György and Claire Vernade and Mohammad Ghavamzadeh},
journal= {arXiv preprint arXiv:2202.13001},
year = {2022}
}