中文

用于对话控制的样本高效深度强化学习

人工智能 2016-12-20 v1 机器学习 机器学习

摘要

将对话策略表示为循环神经网络(RNN)具有吸引力,因为它能处理部分可观测性,推断状态的潜在表示,并可通过监督学习(SL)或强化学习(RL)进行优化。对于RL,策略梯度方法很自然,但样本效率低。在本文中,我们提出了3种方法,以减少使用RL优化基于RNN的对话策略所需的对话数量。其核心思想是维护第二个RNN来预测当前策略的价值,并对两个网络应用经验回放。在两个任务上,与标准策略梯度方法相比,这些方法将所需的对话/回合数减少了约三分之一。

关键词

引用

@article{arxiv.1612.06000,
  title  = {Sample-efficient Deep Reinforcement Learning for Dialog Control},
  author = {Kavosh Asadi and Jason D. Williams},
  journal= {arXiv preprint arXiv:1612.06000},
  year   = {2016}
}