中文

共享仿射子空间内 Bandit 的元学习

机器学习 2024-04-02 v1 机器学习

摘要

我们研究多个上下文随机 bandit 任务的元学习问题,通过利用它们在低维仿射子空间周围的集中性,我们通过在线主成分分析学习该子空间,以减少所遇 bandit 的期望遗憾。我们提出并理论分析了两种解决该问题的策略:一种基于不确定性面对时的乐观原则,另一种通过 Thompson 采样。我们的框架是通用的,并将先前提出的方法作为特例包含在内。此外,实证结果表明,我们的方法显著减少了多个 bandit 任务上的遗憾。

关键词

引用

@article{arxiv.2404.00688,
  title  = {Meta Learning in Bandits within Shared Affine Subspaces},
  author = {Steven Bilaj and Sofien Dhouib and Setareh Maghsudi},
  journal= {arXiv preprint arXiv:2404.00688},
  year   = {2024}
}

备注

Accepted in AISTATS 2024