终身_bandit 优化:无先验且无遗憾
机器学习
2023-06-21 v3 人工智能
机器学习
摘要
机器学习算法常常被一遍又一遍地重复应用于具有相似结构的问题上。我们专注于求解一系列 bandit 优化任务,并开发了 LIBO,一种通过从过往经验中学习来适应环境并在此过程中变得更样本高效的算法。我们假设一个核化结构,其中核未知但在所有任务间共享。LIBO 顺序式元学习一个逼近真实核的核,并用最新核估计求解到来任务。我们的算法可与任何核化或线性 bandit 算法配对,并保证预言机最优性能,意味着随着更多任务被求解,LIBO 在每个任务上的遗憾收敛于具有真实核预言机知识的 bandit 算法的遗憾。自然地,若与次线性 bandit 算法配对,LIBO 产生次线性终身遗憾。我们还表明,直接访问每个任务的数据对于获得次线性遗憾并非必要。我们提出 F-LIBO,以联邦方式求解终身问题。
引用
@article{arxiv.2210.15513,
title = {Lifelong Bandit Optimization: No Prior and No Regret},
author = {Felix Schur and Parnian Kassraie and Jonas Rothfuss and Andreas Krause},
journal= {arXiv preprint arXiv:2210.15513},
year = {2023}
}
备注
35 pages, 6 figures, In Proceedings of UAI 2023