多选择对抗赌博机设定中的未知延迟问题
机器学习
2020-10-02 v1 多智能体系统
机器学习
摘要
本文研究多选择对抗多臂赌博机(MAB)中的未知延迟问题。现有关于类似博弈设定的工作仅关注学习者在每轮选择一个臂的情形。然而,在机器人领域存在大量应用需要学习者在每轮选择多于一个臂。因此,研究当选择多个臂时延迟的影响是有价值的。该设定下每轮选择的多个臂经历相同大小的延迟。不同轮次所选不同臂组合的损失反馈可能聚合,学习者面临将损失反馈关联到产生它们的臂的挑战。为解决此问题,本文提出一种延迟指数、利用与探索多选择(DEXP3.M)算法。其遗憾界仅比已提出的单选择未知延迟设定下的DEXP3的遗憾稍差。
引用
@article{arxiv.2010.00161,
title = {Unknown Delay for Adversarial Bandit Setting with Multiple Play},
author = {Olusola T. Odeyomi},
journal= {arXiv preprint arXiv:2010.00161},
year = {2020}
}
备注
9 pages, 2 figures