中文

瓶颈模拟器:一种基于模型的深度强化学习方法

机器学习 2018-07-13 v1 人工智能 计算与语言 神经与进化计算 机器学习

摘要

深度强化学习近来展现出诸多令人瞩目的成功。然而,将此类方法应用于现实世界问题的一大障碍是其缺乏数据效率。为此,我们提出瓶颈模拟器(Bottleneck Simulator):一种基于模型的强化学习方法,它将习得的环境因子化转移模型与展开模拟相结合,以从少量样本中学习有效策略。习得的转移模型采用抽象的离散(瓶颈)状态,其通过减少模型参数数量并利用环境的结构特性来提升样本效率。我们从所学策略不动点的角度对瓶颈模拟器进行了数学分析,揭示了性能如何受四类不同误差源影响:与抽象空间结构相关的误差、与转移模型估计方差相关的误差、与转移模型估计偏差相关的误差,以及与转移模型类偏差相关的误差。最后,我们在两个自然语言处理任务上评估了瓶颈模拟器:一个文本冒险游戏和一个真实的复杂对话响应选择任务。在两项任务上,瓶颈模拟器均取得优异性能,击败了竞争方法。

关键词

引用

@article{arxiv.1807.04723,
  title  = {The Bottleneck Simulator: A Model-based Deep Reinforcement Learning Approach},
  author = {Iulian Vlad Serban and Chinnadhurai Sankar and Michael Pieper and Joelle Pineau and Yoshua Bengio},
  journal= {arXiv preprint arXiv:1807.04723},
  year   = {2018}
}

备注

26 pages, 2 figures, 4 tables