共享仿射子空间内 Bandit 的元学习
机器学习
2024-04-02 v1 机器学习
摘要
我们研究多个上下文随机 bandit 任务的元学习问题,通过利用它们在低维仿射子空间周围的集中性,我们通过在线主成分分析学习该子空间,以减少所遇 bandit 的期望遗憾。我们提出并理论分析了两种解决该问题的策略:一种基于不确定性面对时的乐观原则,另一种通过 Thompson 采样。我们的框架是通用的,并将先前提出的方法作为特例包含在内。此外,实证结果表明,我们的方法显著减少了多个 bandit 任务上的遗憾。
引用
@article{arxiv.2404.00688,
title = {Meta Learning in Bandits within Shared Affine Subspaces},
author = {Steven Bilaj and Sofien Dhouib and Setareh Maghsudi},
journal= {arXiv preprint arXiv:2404.00688},
year = {2024}
}
备注
Accepted in AISTATS 2024