中文

带采样上下文的贪心 Bandit 算法

机器学习 2020-08-03 v1 人工智能

摘要

上下文 Bandit 的贝叶斯策略通过使用来自环境的上下文信息建模不确定性,在单状态强化学习任务中已证明有前景。本文提出带采样上下文的贪心 Bandit(GB-SC),一种用于上下文多臂 Bandit 的方法,利用 Thompson Sampling 从上下文信息开发先验,并使用 epsilon-greedy 策略进行臂选择。框架 GB-SC 允许评估上下文-奖励依赖性,并通过利用所开发的先验为部分可观测上下文向量提供鲁棒性。我们的实验结果显示在 Mushroom 环境下于期望遗憾与期望累积遗憾方面具有竞争性能,并提供了关于各上下文子集如何影响决策的见解。

关键词

引用

@article{arxiv.2007.16001,
  title  = {Greedy Bandits with Sampled Context},
  author = {Dom Huh},
  journal= {arXiv preprint arXiv:2007.16001},
  year   = {2020}
}