线性_bandit中纯探索的多任务表示学习
机器学习
2023-05-31 v2
摘要
尽管表示学习在序列决策中近期取得成功,但针对纯探索场景(即识别最优选项并最小化样本复杂度)的研究仍有限。本文研究了线性_bandit中最佳臂识别(RepBAI-LB)和上下文线性_bandit中最佳策略识别(RepBPI-CLB)的多任务表示学习,这是两个具有广泛应用(如临床试验与网页内容优化)的流行纯探索设定。在这两个问题中,所有任务共享一个共同的低维线性表示,我们的目标正是利用该特征加速所有任务的最佳臂(策略)识别过程。针对这些问题,我们设计了计算与样本高效的算法 DouExpDes 与 C-DouExpDes,其通过双实验设计来规划用于学习全局表示的最优样本分配。我们表明,通过学习任务间的共同表示,我们的样本复杂度显著优于独立求解任务的原生方法。据我们所知,这是首次证明表示学习对多任务纯探索的益处。
引用
@article{arxiv.2302.04441,
title = {Multi-task Representation Learning for Pure Exploration in Linear Bandits},
author = {Yihan Du and Longbo Huang and Wen Sun},
journal= {arXiv preprint arXiv:2302.04441},
year = {2023}
}