BBQ-Networks:面向任务型对话系统的深度强化学习高效探索
机器学习
2017-11-29 v4 神经与进化计算
机器学习
摘要
我们提出了一种新算法,显著提高了对话系统中深度 Q 学习智能体的探索效率。我们的智能体通过汤普森采样进行探索,从 Bayes-by-Backprop 神经网络中抽取蒙特卡洛样本。我们的算法学习速度远快于常见的探索策略,如 epsilon-贪婪、玻尔兹曼、自助法和基于内在奖励的策略。此外,我们表明,仅用少数成功回合的经验填充重放缓冲区,就能使 Q 学习在原本可能失败的情况下变得可行。
引用
@article{arxiv.1608.05081,
title = {BBQ-Networks: Efficient Exploration in Deep Reinforcement Learning for Task-Oriented Dialogue Systems},
author = {Zachary C. Lipton and Xiujun Li and Jianfeng Gao and Lihong Li and Faisal Ahmed and Li Deng},
journal= {arXiv preprint arXiv:1608.05081},
year = {2017}
}
备注
13 pages, 9 figures