基于随机线性bandit的多任务表示学习
机器学习
2023-08-16 v2 机器学习
摘要
我们研究随机线性bandit任务设定中的迁移学习问题。我们考虑一个低维线性表示在任务间共享,并研究在多任务学习设定中学习该表示带来的益处。遵循近期设计随机bandit策略的结果,我们提出了一种基于迹范数正则化的高效贪心策略。它通过鼓励由任务回归向量构成的矩阵为低秩来隐式学习低维表示。与文献中先前工作不同,我们的策略无需知道底层矩阵的秩。我们推导了策略多任务regret的上界,其直至对数因子为 阶,其中 为任务数, 为秩, 为变量数, 为每个任务的轮数。我们展示了相比通过独立求解每个任务所得基线 的策略优势。我们还给出了多任务regret的下界。最后,我们用合成数据的初步实验证实了理论发现。
引用
@article{arxiv.2202.10066,
title = {Multi-task Representation Learning with Stochastic Linear Bandits},
author = {Leonardo Cella and Karim Lounici and Grégoire Pacreau and Massimiliano Pontil},
journal= {arXiv preprint arXiv:2202.10066},
year = {2023}
}