具有长程奖励的随机上下文_bandits
机器学习
2023-02-07 v2 人工智能
机器学习
摘要
对复杂决策与语言建模问题日益增长的兴趣,凸显了在极长时域上样本高效学习的重要性。本文朝此方向迈进一步,研究上下文线性bandits,其中当前奖励依赖于至多个先前的动作与上下文(未必连续),时域上限为。为避免对的多项式依赖,我们提出利用稀疏性联合发现依赖模式与臂参数的新算法。我们考虑数据匮乏()与数据充裕()两种情形,并分别导出遗憾上界与,其中稀疏度、特征维数、总时域,以及自适应于奖励依赖模式的。作为上界的补充,我们也表明在单一轨迹上学习带来固有挑战:尽管依赖模式与臂参数构成秩1矩阵,循环矩阵在秩1流形上非等距,且样本复杂度确实受益于稀疏奖励依赖结构。我们的结果需要一种新的分析,以应对数据间长程时间依赖并避免对奖励时域的多项式依赖。具体而言,我们利用由相关次高斯向量构成的循环矩阵的限制等距性质之联系,并建立同样具有独立意义的新保证。
引用
@article{arxiv.2302.00814,
title = {Stochastic Contextual Bandits with Long Horizon Rewards},
author = {Yuzhen Qin and Yingcong Li and Fabio Pasqualetti and Maryam Fazel and Samet Oymak},
journal= {arXiv preprint arXiv:2302.00814},
year = {2023}
}
备注
47 pages, to appear at AAAI 2023