中文

线性_bandit中纯探索的多任务表示学习

机器学习 2023-05-31 v2

摘要

尽管表示学习在序列决策中近期取得成功,但针对纯探索场景(即识别最优选项并最小化样本复杂度)的研究仍有限。本文研究了线性_bandit中最佳臂识别(RepBAI-LB)和上下文线性_bandit中最佳策略识别(RepBPI-CLB)的多任务表示学习,这是两个具有广泛应用(如临床试验与网页内容优化)的流行纯探索设定。在这两个问题中,所有任务共享一个共同的低维线性表示,我们的目标正是利用该特征加速所有任务的最佳臂(策略)识别过程。针对这些问题,我们设计了计算与样本高效的算法 DouExpDes 与 C-DouExpDes,其通过双实验设计来规划用于学习全局表示的最优样本分配。我们表明,通过学习任务间的共同表示,我们的样本复杂度显著优于独立求解任务的原生方法。据我们所知,这是首次证明表示学习对多任务纯探索的益处。

关键词

引用

@article{arxiv.2302.04441,
  title  = {Multi-task Representation Learning for Pure Exploration in Linear Bandits},
  author = {Yihan Du and Longbo Huang and Wen Sun},
  journal= {arXiv preprint arXiv:2302.04441},
  year   = {2023}
}