中文

具有非平稳奖励的多臂老虎机问题中的最优探索 - 利用

机器学习 2019-06-11 v2 最优化与控制 概率论 机器学习

摘要

在多臂老虎机 (MAB) 问题中,赌徒在每一轮游戏中需要从 K 个臂中选择一个,每个臂的特征由未知的奖励分布描述。仅当选中某个臂时才能观察到奖励实现,赌徒的目标是在给定的游戏视界 T 内最大化其累积期望收益。为此,赌徒需要在获取关于臂的信息(探索)的同时优化即时奖励(利用);这种权衡所付出的代价通常被称为遗憾 (regret),主要问题在于作为视界长度 T 的函数,这一代价可以有多小。当奖励分布不随时间变化时,该问题已被广泛研究;这一假设支持对遗憾的尖锐刻画,但在实际场景中往往被违背。在本文中,我们关注一种允许奖励中存在广泛时间不确定性的 MAB 表述,同时保持数学上的可处理性。通过建立允许的奖励“变化”程度与可实现的最小遗憾之间的直接联系,我们完全刻画了此类 MAB 问题的(遗憾)复杂性。我们的分析在两个截然不同的文献流派之间建立了一些联系:对抗性 MAB 框架和随机性 MAB 框架。

关键词

引用

@article{arxiv.1405.3316,
  title  = {Optimal Exploration-Exploitation in a Multi-Armed-Bandit Problem with Non-stationary Rewards},
  author = {Omar Besbes and Yonatan Gur and Assaf Zeevi},
  journal= {arXiv preprint arXiv:1405.3316},
  year   = {2019}
}