中文

具有任意反馈延迟的无尺度对抗多臂_bandit问题

机器学习 2023-01-27 v3 机器学习

摘要

我们考虑具有无限制反馈延迟的无尺度对抗多臂_bandit(MAB)问题。与损失均为[0,1][0,1]有界的标准假设不同,在我们的设定中,损失可落于一般有界区间[L,L][-L, L]内,且智能体事先未知。此外,每次臂拉动的反馈可经历任意延迟。我们针对此新设定提出了一种名为无尺度延迟INF(SFD-INF)的新方法,其结合了近期的“凸组合技巧”与一种新颖的倍增跳过技术。随后我们给出SFD-INF的两个实例,各自带有精心设计的延迟自适应学习尺度。第一个SFD-TINF使用12\frac 12-Tsallis熵正则化器,在损失非负时可达到O~(K(D+T)L)\widetilde{\mathcal O}(\sqrt{K(D+T)}L)遗憾,其中KK为动作数,TT为步数,DD为总反馈延迟。当将KK视为独立于TT的常数时,该界几乎匹配Ω((KT+DlogK)L)\Omega((\sqrt{KT}+\sqrt{D\log K})L)下界。第二个SFD-LBINF适用于一般无尺度损失,并达到小损失风格的自适应遗憾界O~(KE[L~T2]+KDL)\widetilde{\mathcal O}(\sqrt{K\mathbb{E}[\tilde{\mathfrak L}_T^2]}+\sqrt{KDL}),其在最坏情况下退化为O~(K(D+T)L)\widetilde{\mathcal O}(\sqrt{K(D+T)}L)遗憾,因此尽管分析更复杂且多出若干对数依赖,仍比SFD-TINF更通用。此外,两个实例也优于现有的无延迟(即D=0D=0)无尺度对抗MAB问题算法,这本身具有独立意义。

关键词

引用

@article{arxiv.2110.13400,
  title  = {Scale-Free Adversarial Multi-Armed Bandit with Arbitrary Feedback Delays},
  author = {Jiatai Huang and Yan Dai and Longbo Huang},
  journal= {arXiv preprint arXiv:2110.13400},
  year   = {2023}
}

备注

Preliminary work, merged to arXiv:2301.10500