中文

Q函数复用对表格化、无模型强化学习总后悔界的影响

机器学习 2021-03-09 v1

摘要

一些强化学习方法存在高样本复杂度的问题,导致它们在现实场景中不实用。QQ函数复用作为一种迁移学习方法,是降低学习样本复杂度的一种途径,有可能提升现有算法的实用性。先前的工作已展示了将QQ函数复用应用于无模型算法时在各种环境下的经验有效性。据我们所知,尚无理论工作揭示在表格化、无模型设定下应用QQ函数复用的后悔界。我们旨在通过为将QQ函数复用应用于带UCB-Hoeffding的QQ学习算法时的有效性提供若干理论见解,来弥合QQ函数复用中理论与经验工作之间的鸿沟。我们的主要贡献是表明,在特定情形下,若将QQ函数复用应用于带UCB-Hoeffding的QQ学习算法,其后悔界与状态空间或动作空间无关。我们还提供了支持我们理论发现的经验结果。

关键词

引用

@article{arxiv.2103.04416,
  title  = {The Effect of Q-function Reuse on the Total Regret of Tabular, Model-Free, Reinforcement Learning},
  author = {Volodymyr Tkachuk and Sriram Ganapathi Subramanian and Matthew E. Taylor},
  journal= {arXiv preprint arXiv:2103.04416},
  year   = {2021}
}

备注

7 pages, 2 figures, submitted to ALA 2021