中文

BBQ-Networks:面向任务型对话系统的深度强化学习高效探索

机器学习 2017-11-29 v4 神经与进化计算 机器学习

摘要

我们提出了一种新算法,显著提高了对话系统中深度 Q 学习智能体的探索效率。我们的智能体通过汤普森采样进行探索,从 Bayes-by-Backprop 神经网络中抽取蒙特卡洛样本。我们的算法学习速度远快于常见的探索策略,如 epsilon-贪婪、玻尔兹曼、自助法和基于内在奖励的策略。此外,我们表明,仅用少数成功回合的经验填充重放缓冲区,就能使 Q 学习在原本可能失败的情况下变得可行。

关键词

引用

@article{arxiv.1608.05081,
  title  = {BBQ-Networks: Efficient Exploration in Deep Reinforcement Learning for Task-Oriented Dialogue Systems},
  author = {Zachary C. Lipton and Xiujun Li and Jianfeng Gao and Lihong Li and Faisal Ahmed and Li Deng},
  journal= {arXiv preprint arXiv:1608.05081},
  year   = {2017}
}

备注

13 pages, 9 figures