Q函数复用对表格化、无模型强化学习总后悔界的影响
机器学习
2021-03-09 v1
摘要
一些强化学习方法存在高样本复杂度的问题,导致它们在现实场景中不实用。函数复用作为一种迁移学习方法,是降低学习样本复杂度的一种途径,有可能提升现有算法的实用性。先前的工作已展示了将函数复用应用于无模型算法时在各种环境下的经验有效性。据我们所知,尚无理论工作揭示在表格化、无模型设定下应用函数复用的后悔界。我们旨在通过为将函数复用应用于带UCB-Hoeffding的学习算法时的有效性提供若干理论见解,来弥合函数复用中理论与经验工作之间的鸿沟。我们的主要贡献是表明,在特定情形下,若将函数复用应用于带UCB-Hoeffding的学习算法,其后悔界与状态空间或动作空间无关。我们还提供了支持我们理论发现的经验结果。
引用
@article{arxiv.2103.04416,
title = {The Effect of Q-function Reuse on the Total Regret of Tabular, Model-Free, Reinforcement Learning},
author = {Volodymyr Tkachuk and Sriram Ganapathi Subramanian and Matthew E. Taylor},
journal= {arXiv preprint arXiv:2103.04416},
year = {2021}
}
备注
7 pages, 2 figures, submitted to ALA 2021