中文

判别型深度 Dyna-Q:面向对话策略学习的鲁棒规划

计算与语言 2018-09-07 v2 人工智能 机器学习

摘要

本文提出一种判别型深度 Dyna-Q(D3Q)方法,以改进深度 Dyna-Q(DDQ)的有效性与鲁棒性;DDQ 是近期提出的将 Dyna-Q 算法扩展以集成规划用于任务型对话策略学习的框架。为消除 DDQ 对模拟经验质量的严重依赖,我们在 D3Q 中引入基于 RNN 的判别器,以区分模拟经验与真实用户经验,从而控制训练数据质量。实验表明,D3Q 通过控制用于规划的模拟经验质量显著优于 DDQ。D3Q 的有效性与鲁棒性在领域扩展设定中进一步得到验证,该设定测试了智能体适应变化环境的能力。

关键词

引用

@article{arxiv.1808.09442,
  title  = {Discriminative Deep Dyna-Q: Robust Planning for Dialogue Policy Learning},
  author = {Shang-Yu Su and Xiujun Li and Jianfeng Gao and Jingjing Liu and Yun-Nung Chen},
  journal= {arXiv preprint arXiv:1808.09442},
  year   = {2018}
}

备注

11 pages, 10 figures, EMNLP 2018 long paper