带采样上下文的贪心 Bandit 算法
机器学习
2020-08-03 v1 人工智能
摘要
上下文 Bandit 的贝叶斯策略通过使用来自环境的上下文信息建模不确定性,在单状态强化学习任务中已证明有前景。本文提出带采样上下文的贪心 Bandit(GB-SC),一种用于上下文多臂 Bandit 的方法,利用 Thompson Sampling 从上下文信息开发先验,并使用 epsilon-greedy 策略进行臂选择。框架 GB-SC 允许评估上下文-奖励依赖性,并通过利用所开发的先验为部分可观测上下文向量提供鲁棒性。我们的实验结果显示在 Mushroom 环境下于期望遗憾与期望累积遗憾方面具有竞争性能,并提供了关于各上下文子集如何影响决策的见解。
引用
@article{arxiv.2007.16001,
title = {Greedy Bandits with Sampled Context},
author = {Dom Huh},
journal= {arXiv preprint arXiv:2007.16001},
year = {2020}
}