中文

在线优惠券收集问题及其在终身强化学习中的应用

机器学习 2015-09-23 v2 人工智能

摘要

在强化学习(RL)中,跨一系列相关任务迁移知识是一个重要挑战。尽管有诸多令人鼓舞的经验证据,但理论研究甚少。本文研究一类终身RL问题:智能体求解由有限马尔可夫决策过程(MDPs)序列建模的任务,每个任务来自具有相同状态/动作集和不同转移/奖励函数的有限MDP集合。受终身学习中跨任务探索需求的启发,我们公式化了一个新颖的在线优惠券收集问题并给出最优算法。这使我们能够开发一种新的终身RL算法,其在任务序列上的总体样本复杂度远小于单任务学习,即使任务序列由对手生成。该算法的优势在模拟问题中得到展示,包括一个最近提出的人机交互问题。

关键词

引用

@article{arxiv.1506.03379,
  title  = {The Online Coupon-Collector Problem and Its Application to Lifelong Reinforcement Learning},
  author = {Emma Brunskill and Lihong Li},
  journal= {arXiv preprint arXiv:1506.03379},
  year   = {2015}
}

备注

13 pages