中文

超越任务多样性:顺序多任务线性 bandits 的可证明表示迁移

机器学习 2025-01-24 v1

摘要

我们研究了线性 bandits 中的终身学习问题,其中学习者与一系列参数位于 Rd\mathbb{R}^dmm 维子空间内的线性 bandits 任务互动,从而共享低秩表示。当前文献通常假设任务具有多样性,即任务参数均匀覆盖该 mm 维子空间。这一假设允许在所有任务公开之前学习低秩表示,这在实际应用中可能不切实际。在本文中,我们提出了第一个不具备任务多样性假设的序列多任务线性 bandits 的非平凡结果。我们发展了一种高效学习和迁移低秩表示的算法。当面对 NN 个任务时,每个任务进行 τ\tau 轮我们的算法,在椭球动作集假设下实现了 O~(Nmτ+N23τ23dm13+Nd2+τmd)\tilde{O}\big (Nm \sqrt{\tau} + N^{\frac{2}{3}} \tau^{\frac{2}{3}} d m^{\frac13} + Nd^2 + \tau m d \big) 的 regret 保证。这一结果在任务数量 NN 足够大且 mdm \ll d 时,可显著优于不利用低秩结构的基准 O~(Ndτ)\tilde{O} \left (Nd \sqrt{\tau}\right)。我们还在合成数据上表明,我们的算法优于依赖任务多样性假设的基准算法。

关键词

引用

@article{arxiv.2501.13390,
  title  = {Beyond Task Diversity: Provable Representation Transfer for Sequential Multi-Task Linear Bandits},
  author = {Thang Duong and Zhi Wang and Chicheng Zhang},
  journal= {arXiv preprint arXiv:2501.13390},
  year   = {2025}
}

备注

38th Conference on Neural Information Processing Systems (NeurIPS 2024)