中文

自回归赌博机

机器学习 2024-02-21 v2 机器学习

摘要

自回归过程自然出现在大量现实场景中,包括股票市场、销售预测、天气预测、广告和定价。当在此类背景下面对序贯决策问题时,应适当考虑连续观测之间的时间依赖性,以保证收敛到最优策略。在这项工作中,我们提出了一种新颖的在线学习设定,即自回归赌博机(Autoregressive Bandits, ARBs),其中观测到的奖励由阶数为 kk 的自回归过程控制,其参数依赖于所选择的动作。我们表明,在关于奖励过程的温和假设下,最优策略可以方便地计算。然后,我们设计了一种新的乐观后悔最小化算法,即自回归上置信界(AutoRegressive Upper Confidence Bound, AR-UCB),其承受阶数为 O~((k+1)3/2nT(1Γ)2)\widetilde{\mathcal{O}} \left( \frac{(k+1)^{3/2}\sqrt{nT}}{(1-\Gamma)^2}\right) 的次线性后悔,其中 TT 是优化时域,nn 是动作数量,Γ<1\Gamma < 1 是过程的稳定性指数。最后,我们通过实验验证了我们的算法,说明了其相对于赌博机基线的优势以及其对关键参数设定错误的鲁棒性。

关键词

引用

@article{arxiv.2212.06251,
  title  = {Autoregressive Bandits},
  author = {Francesco Bacchiocchi and Gianmarco Genalti and Davide Maran and Marco Mussi and Marcello Restelli and Nicola Gatti and Alberto Maria Metelli},
  journal= {arXiv preprint arXiv:2212.06251},
  year   = {2024}
}

备注

Accepted to AISTATS 2024