具有对抗性休眠的决斗_bandit问题
机器学习
2021-07-07 v1 人工智能
摘要
我们引入具有随机偏好与对抗性可用性的休眠决斗_bandit问题(DB-SPAA)。在几乎所有决斗_bandit应用中,决策空间常随时间变化;例如零售店管理、在线购物、餐厅推荐、搜索引擎优化等。令人惊讶的是,决斗_bandit的这一“休眠方面”此前从未被文献研究。与决斗_bandit类似,目标是通过顺序查询物品对的偏好反馈来与最优臂竞争。然而,非平凡性源于允许任意子集物品在每轮变为不可用的非平稳物品空间。目标是找到一种最优的“无遗憾”策略,能在每轮识别出最优可用物品,而非决斗_bandit标准的“固定最优臂遗憾目标”。我们首先推导出 DB-SPAA 的实例相关下界 ,其中 为物品数, 为物品 与 间的差距。这表明带偏好反馈的休眠问题本质上比经典多臂_bandit(MAB)更困难。随后我们提出两种具有近最优遗憾保证的算法。我们的结果得到了实证支持。
引用
@article{arxiv.2107.02274,
title = {Dueling Bandits with Adversarial Sleeping},
author = {Aadirupa Saha and Pierre Gaillard},
journal= {arXiv preprint arXiv:2107.02274},
year = {2021}
}