具有任意反馈延迟的无尺度对抗多臂_bandit问题
机器学习
2023-01-27 v3 机器学习
摘要
我们考虑具有无限制反馈延迟的无尺度对抗多臂_bandit(MAB)问题。与损失均为有界的标准假设不同,在我们的设定中,损失可落于一般有界区间内,且智能体事先未知。此外,每次臂拉动的反馈可经历任意延迟。我们针对此新设定提出了一种名为无尺度延迟INF(SFD-INF)的新方法,其结合了近期的“凸组合技巧”与一种新颖的倍增跳过技术。随后我们给出SFD-INF的两个实例,各自带有精心设计的延迟自适应学习尺度。第一个SFD-TINF使用-Tsallis熵正则化器,在损失非负时可达到遗憾,其中为动作数,为步数,为总反馈延迟。当将视为独立于的常数时,该界几乎匹配下界。第二个SFD-LBINF适用于一般无尺度损失,并达到小损失风格的自适应遗憾界,其在最坏情况下退化为遗憾,因此尽管分析更复杂且多出若干对数依赖,仍比SFD-TINF更通用。此外,两个实例也优于现有的无延迟(即)无尺度对抗MAB问题算法,这本身具有独立意义。
引用
@article{arxiv.2110.13400,
title = {Scale-Free Adversarial Multi-Armed Bandit with Arbitrary Feedback Delays},
author = {Jiatai Huang and Yan Dai and Longbo Huang},
journal= {arXiv preprint arXiv:2110.13400},
year = {2023}
}
备注
Preliminary work, merged to arXiv:2301.10500