判别型深度 Dyna-Q:面向对话策略学习的鲁棒规划
计算与语言
2018-09-07 v2 人工智能
机器学习
摘要
本文提出一种判别型深度 Dyna-Q(D3Q)方法,以改进深度 Dyna-Q(DDQ)的有效性与鲁棒性;DDQ 是近期提出的将 Dyna-Q 算法扩展以集成规划用于任务型对话策略学习的框架。为消除 DDQ 对模拟经验质量的严重依赖,我们在 D3Q 中引入基于 RNN 的判别器,以区分模拟经验与真实用户经验,从而控制训练数据质量。实验表明,D3Q 通过控制用于规划的模拟经验质量显著优于 DDQ。D3Q 的有效性与鲁棒性在领域扩展设定中进一步得到验证,该设定测试了智能体适应变化环境的能力。
引用
@article{arxiv.1808.09442,
title = {Discriminative Deep Dyna-Q: Robust Planning for Dialogue Policy Learning},
author = {Shang-Yu Su and Xiujun Li and Jianfeng Gao and Jingjing Liu and Yun-Nung Chen},
journal= {arXiv preprint arXiv:1808.09442},
year = {2018}
}
备注
11 pages, 10 figures, EMNLP 2018 long paper