短视界多臂老虎机中的回归预言机与探索策略
机器学习
2021-02-11 v1 人工智能
机器学习
摘要
本文探讨了极短视界场景下的多臂老虎机(MAB)策略,即老虎机策略只允许与环境进行极少次交互。这是 MAB 文献中研究不足的设置,在游戏等场景中有诸多应用,例如玩家建模。具体而言,我们推进了三种不同的思路。首先,我们探索使用回归预言机(regression oracles),以线性回归模型替代 epsilon-greedy 等策略中使用的简单平均。其次,我们考察了不同的探索模式,例如强制探索阶段。最后,我们引入了 UCB1 策略的一种新变体,称为 UCBT,它具有有趣的性质且无可调参数。我们在受运动游戏(exergames)启发的领域中展示了实验结果,其目标是最大化玩家的每日步数。我们的结果表明,在短视界设置下,epsilon-greedy 或 epsilon-decreasing 与回归预言机的组合优于所有其他被测策略。
引用
@article{arxiv.2102.05263,
title = {Regression Oracles and Exploration Strategies for Short-Horizon Multi-Armed Bandits},
author = {Robert C. Gray and Jichen Zhu and Santiago Ontañón},
journal= {arXiv preprint arXiv:2102.05263},
year = {2021}
}
备注
8 pages