中文

目标迁移 Q-Learning 及其收敛性分析

机器学习 2018-09-25 v1 人工智能 机器人学 机器学习

摘要

Q-learning 是强化学习(RL)中最受欢迎的方法之一。迁移学习旨在利用从源任务中学到的知识来帮助新任务,从而降低新任务的样本复杂度。考虑到 RL 中的数据收集既耗时又耗成本,且相较于监督学习 Q-learning 收敛缓慢,人们设计了多种迁移 RL 算法。然而,其中大多数属于启发式方法,缺乏收敛速率的理论保证。因此,清晰地理解迁移学习何时以及如何帮助 RL 方法,并为样本复杂度的改善提供理论保证,十分重要。本文提出在满足特定安全条件时,将源任务中学到的 Q-函数迁移到新任务中 Q-learning 的目标上。我们将这一新的迁移 Q-learning 方法称为目标迁移 Q-Learning(target transfer Q-Learning)。安全条件对于避免对新任务造成损害、从而确保算法收敛是必要的。我们研究了目标迁移 Q-learning 的收敛速率。我们证明,若两个任务在 MDP 意义上相似,则源任务与新 RL 任务中的最优 Q-函数相似,这意味着迁移得到的目标 Q-函数在新的 MDP 中误差较小。此外,收敛速率分析表明,若迁移目标 Q-函数的误差小于新任务中当前 Q-函数,则目标迁移 Q-Learning 将比 Q-learning 收敛更快。基于我们的理论结果,我们将安全条件设计为:迁移目标 Q-函数的 Bellman 误差小于当前 Q-函数。我们的实验与理论发现一致,并验证了所提目标迁移 Q-learning 方法的有效性。

关键词

引用

@article{arxiv.1809.08923,
  title  = {Target Transfer Q-Learning and Its Convergence Analysis},
  author = {Yue Wang and Qi Meng and Wei Cheng and Yuting Liug and Zhi-Ming Ma and Tie-Yan Liu},
  journal= {arXiv preprint arXiv:1809.08923},
  year   = {2018}
}