用于对话系统的两阶段训练策略网络
计算与语言
2016-09-13 v4 人工智能
摘要
在本文中,我们提出使用基于优势演员-评论家方法训练的深度策略网络,用于统计优化的对话系统。首先,我们展示在摘要状态和动作空间上,深度强化学习 (RL) 优于高斯过程方法。摘要状态和动作空间带来了良好的性能,但需要预工程工作、RL 知识和领域专业知识。为了消除定义此类摘要空间的需求,我们展示了深度 RL 也可以在原始状态和动作空间上高效训练。基于部分可观测马尔可夫决策过程的对话系统已知需要大量对话进行训练,这使其对于实际部署缺乏吸引力。我们展示了基于演员-评论家架构的深度 RL 方法可以非常高效地利用少量数据。事实上,仅利用人工设计策略收集的几百个对话,通过监督学习和批量 RL 的结合,演员-评论家深度学习器即可实现显著的自举。此外,与在数据上以批量 RL 初始化的其他深度 RL 方法相比,其向最优策略的收敛速度显著加快。所有实验均在源自对话状态跟踪挑战赛 2 (DSTC2) 数据集的餐厅领域上进行。
引用
@article{arxiv.1606.03152,
title = {Policy Networks with Two-Stage Training for Dialogue Systems},
author = {Mehdi Fatemi and Layla El Asri and Hannes Schulz and Jing He and Kaheer Suleman},
journal= {arXiv preprint arXiv:1606.03152},
year = {2016}
}
备注
SIGDial 2016 (Submitted: May 2016; Accepted: Jun 30, 2016)