中文

两全其美的线性上下文赌博机

机器学习 2023-12-29 v1 人工智能 计量经济学 统计方法学 机器学习

摘要

本研究研究了在对抗性腐败下的KK臂线性上下文赌博机问题,这是多臂赌博机问题的一个实例。每一轮,决策者观察一个独立同分布的上下文,然后基于上下文和过去的观察选择一个臂。选择臂后,决策者遭受与该臂对应的损失。决策者的目标是最小化试验期间的累积损失。本研究的目标是开发一种在随机和对抗环境中都有效且具有理论保证的策略。我们首先通过引入一种新的带对抗性腐败的赌博机设置(称为具有自限约束的上下文对抗性机制)来形式化该问题。我们假设损失与上下文之间的关系是线性模型。然后,我们提出了一种扩展Neu & Olkhovskaya (2020)的RealLinExp3和跟随正则化领导者(FTRL)的策略。我们提出的算法的遗憾被证明上界为O(min{(log(T))3Δ+C(log(T))3Δ,  T(log(T))2})O\left(\min\left\{\frac{(\log(T))^3}{\Delta_{*}} + \sqrt{\frac{C(\log(T))^3}{\Delta_{*}}},\ \ \sqrt{T}(\log(T))^2\right\}\right),其中TNT \in\mathbb{N}是轮数,Δ>0\Delta_{*} > 0是任何上下文中最佳臂与次优臂之间的恒定最小差距,C[0,T]C\in[0, T]是对抗性腐败参数。这个遗憾上界意味着在随机环境中为O((log(T))3Δ)O\left(\frac{(\log(T))^3}{\Delta_{*}}\right),在对抗环境中为O(T(log(T))2)O\left( \sqrt{T}(\log(T))^2\right)。我们将我们的策略称为两全其美(BoBW)RealFTRL,因为它在随机和对抗环境中都具有理论保证。

关键词

引用

@article{arxiv.2312.16489,
  title  = {Best-of-Both-Worlds Linear Contextual Bandits},
  author = {Masahiro Kato and Shinji Ito},
  journal= {arXiv preprint arXiv:2312.16489},
  year   = {2023}
}