通过初始纯探索实现高效强化学习
摘要
在若干现实场景中,一个交互式学习智能体可以在接受评估之前先练习并优化其策略。例如,设想一名学生正在为一系列考试做准备。她通常会先做一些模拟测试,以了解自己需要改进的领域。基于这些模拟测试的得分,她会制定一个策略,以最大化在实际考试中的成绩。我们在一个智能体探索固定时间步长的 episodic 马尔可夫决策过程(MDP)的背景下处理这一场景,其中智能体可以在 MDP 上练习若干 episode(数量未必事先已知),然后才开始为其行动承担 regret。在练习阶段,智能体的目标必须是最大化遵循最优策略的概率。这类似于纯探索(Pure Exploration, PE)问题。我们将多臂赌博机(Multi Armed Bandits, MAB)的 PE 问题扩展到 MDP,并提出了一种称为纯探索后验采样(Posterior Sampling for Pure Exploration, PSPE)的贝叶斯算法,该算法与其赌博机对应算法类似。我们证明,使用 PSPE 时,贝叶斯简单 regret 以最优的指数速率收敛。当智能体开始接受评估时,其目标将是最小化累积 regret。这类似于强化学习(Reinforcement Learning, RL)问题。智能体使用以练习阶段后验初始化的强化学习后验采样算法(Posterior Sampling for Reinforcement Learning, PSRL)。我们假设,这种 PSPE + PSRL 组合是在具有初始练习阶段的 RL 问题中最小化 regret 的最优策略。我们展示的实证结果证明,在练习阶段结束时具有较低的简单 regret 会导致评估期间的累积 regret 较低。
引用
@article{arxiv.1706.02237,
title = {Efficient Reinforcement Learning via Initial Pure Exploration},
author = {Sudeep Raja Putta and Theja Tulabandhula},
journal= {arXiv preprint arXiv:1706.02237},
year = {2017}
}
备注
4 pages, 3 figures, Presented at Reinforcement Learning and Decision Making 2017