中文

基于随机线性bandit的多任务表示学习

机器学习 2023-08-16 v2 机器学习

摘要

我们研究随机线性bandit任务设定中的迁移学习问题。我们考虑一个低维线性表示在任务间共享,并研究在多任务学习设定中学习该表示带来的益处。遵循近期设计随机bandit策略的结果,我们提出了一种基于迹范数正则化的高效贪心策略。它通过鼓励由任务回归向量构成的矩阵为低秩来隐式学习低维表示。与文献中先前工作不同,我们的策略无需知道底层矩阵的秩。我们推导了策略多任务regret的上界,其直至对数因子为 NdT(T+d)r\sqrt{NdT(T+d)r} 阶,其中 TT 为任务数,rr 为秩,dd 为变量数,NN 为每个任务的轮数。我们展示了相比通过独立求解每个任务所得基线 TdNTd\sqrt{N} 的策略优势。我们还给出了多任务regret的下界。最后,我们用合成数据的初步实验证实了理论发现。

关键词

引用

@article{arxiv.2202.10066,
  title  = {Multi-task Representation Learning with Stochastic Linear Bandits},
  author = {Leonardo Cella and Karim Lounici and Grégoire Pacreau and Massimiliano Pontil},
  journal= {arXiv preprint arXiv:2202.10066},
  year   = {2023}
}