中文

基于循环神经网络的奖励塑形以加速口语对话系统在线策略学习

机器学习 2015-08-19 v2 计算与语言

摘要

统计口语对话系统具有能够通过与真实用户交互从数据中被优化的吸引人的特性。然而在强化学习范式中,对话管理器(智能体)常常需要大量时间来探索状态-动作空间以学习以期望的方式行动。当系统用真实用户在线训练且学习代价高昂时,这是一个关键问题。奖励塑形是解决这些问题的一种有前景的技术。在此我们考察三种循环神经网络(RNN)方法,用于在主要(任务导向的)环境反馈之外提供奖励塑形信息。这些RNN在由模拟用户生成的对话的回报上训练,并试图将对话的整体评价向下扩散到回合级别,以更快地将智能体引导至良好行为。在模拟和真实用户场景中,这些RNN均被证明能提高策略学习速度。重要的是,它们不需要用户目标的先验知识。

关键词

引用

@article{arxiv.1508.03391,
  title  = {Reward Shaping with Recurrent Neural Networks for Speeding up On-Line Policy Learning in Spoken Dialogue Systems},
  author = {Pei-Hao Su and David Vandyke and Milica Gasic and Nikola Mrksic and Tsung-Hsien Wen and Steve Young},
  journal= {arXiv preprint arXiv:1508.03391},
  year   = {2015}
}

备注

Accepted for publication in SigDial 2015