中文

具有长程奖励的随机上下文_bandits

机器学习 2023-02-07 v2 人工智能 机器学习

摘要

对复杂决策与语言建模问题日益增长的兴趣,凸显了在极长时域上样本高效学习的重要性。本文朝此方向迈进一步,研究上下文线性bandits,其中当前奖励依赖于至多ss个先前的动作与上下文(未必连续),时域上限为hh。为避免对hh的多项式依赖,我们提出利用稀疏性联合发现依赖模式与臂参数的新算法。我们考虑数据匮乏(T<hT<h)与数据充裕(ThT\ge h)两种情形,并分别导出遗憾上界O~(dsT+min{q,T})\tilde O(d\sqrt{sT} +\min\{ q, T\})O~(sdT)\tilde O(\sqrt{sdT}),其中稀疏度ss、特征维数dd、总时域TT,以及自适应于奖励依赖模式的qq。作为上界的补充,我们也表明在单一轨迹上学习带来固有挑战:尽管依赖模式与臂参数构成秩1矩阵,循环矩阵在秩1流形上非等距,且样本复杂度确实受益于稀疏奖励依赖结构。我们的结果需要一种新的分析,以应对数据间长程时间依赖并避免对奖励时域hh的多项式依赖。具体而言,我们利用由相关次高斯向量构成的循环矩阵的限制等距性质之联系,并建立同样具有独立意义的新保证。

关键词

引用

@article{arxiv.2302.00814,
  title  = {Stochastic Contextual Bandits with Long Horizon Rewards},
  author = {Yuzhen Qin and Yingcong Li and Fabio Pasqualetti and Maryam Fazel and Samet Oymak},
  journal= {arXiv preprint arXiv:2302.00814},
  year   = {2023}
}

备注

47 pages, to appear at AAAI 2023