中文

保守线性多臂 bandit 的多任务表示学习

机器学习 2026-05-13 v1

摘要

本文提出了针对线性 bandit 的受限多任务表示学习(CMTRL)框架。我们考虑 T 个线性 bandit 任务,在 d 维空间中,这些任务共享一个维数为 r 的低维表示,其中 r 远小于 d 和 T 的最小值。此外,任务受到约束,仅允许满足特定安全或性能要求的动作,称为保守(safe) bandit。我们引入一种新算法Safe-Alternating投影梯度下降与最小化(Safe-AltGDmin),在满足给定约束条件的同时恢复低秩特征矩阵。基于该算法,我们提出了针对保守线性 bandit 的多任务表示学习框架,并给出其 regret 和样本复杂度的理论保证。我们展示了实验并将算法性能与基准算法进行了比较。

关键词

引用

@article{arxiv.2605.12176,
  title  = {Multi-Task Representation Learning for Conservative Linear Bandits},
  author = {Jiabin Lin and Shana Moothedath},
  journal= {arXiv preprint arXiv:2605.12176},
  year   = {2026}
}