基于神经网络的高效对话策略优化的不确定性估计
机器学习
2017-12-04 v1 计算与语言
机器学习
神经与进化计算
摘要
在统计对话管理中,对话管理器学习一个将信念状态映射为系统所执行动作的策论。高效探索是策略优化成功的关键。当前的深度强化学习方法非常有前景,但依赖于 epsilon-greedy 探索,从而在学习过程中使用户面临随机的动作选择。诸如高斯过程 SARSA(GPSARSA)等替代方法估计不确定性且样本高效,带来更好的用户体验,但代价是更高的计算复杂度。本文考察了在对话管理背景下从深度 Q 网络(DQN)提取不确定性估计的方法。我们对用于提取不确定性估计的深度贝叶斯方法进行了广泛基准测试,即 Bayes-By-Backprop、dropout、其 concrete 变体、bootstrapped 集成和 alpha-散度,并将其与 DQN 算法结合。
引用
@article{arxiv.1711.11486,
title = {Uncertainty Estimates for Efficient Neural Network-based Dialogue Policy Optimisation},
author = {Christopher Tegho and Paweł Budzianowski and Milica Gašić},
journal= {arXiv preprint arXiv:1711.11486},
year = {2017}
}
备注
Accepted at the Bayesian Deep Learning Workshop, 31st Conference on Neural Information Processing Systems (NIPS 2017)