具有全局凹回报的在线马尔可夫决策过程强化学习中的探索-利用权衡
机器学习
2019-05-17 v1 最优化与控制
机器学习
摘要
我们考虑一个参与马尔可夫决策过程并在每轮收到一个结果向量的智能体。其目标是最大化平均向量结果上的全局凹回报函数。该问题建模了诸如多目标优化、最大熵探索以及马尔可夫环境中的约束优化等应用。在我们的一般设定中,平稳策略可能具有多个常返类,智能体面临着在不同动作间交替以平衡向量结果时的一个微妙但重要的权衡。特别地,平稳策略通常是次优的。我们提出了一种基于在线凸优化(OCO)工具(Agrawal 和 Devanur 2014)和 UCRL2(Jaksch 等人 2010)的无遗憾算法。重要的是,我们引入了一种新颖的梯度阈值过程,它仔细控制动作间的切换以处理这一微妙的权衡。通过延迟梯度更新,我们的过程产生了一个非平稳策略,使结果多样化以优化目标。该过程与多种 OCO 工具兼容。
引用
@article{arxiv.1905.06466,
title = {Exploration-Exploitation Trade-off in Reinforcement Learning on Online Markov Decision Processes with Global Concave Rewards},
author = {Wang Chi Cheung},
journal= {arXiv preprint arXiv:1905.06466},
year = {2019}
}
备注
54 pages, 1 figure