基于级联 LSTM 的深度强化学习用于目标驱动对话
计算与语言
2019-11-01 v1 人工智能
摘要
本文提出一种深度神经网络模型,用于目标驱动对话系统中自然语言理解(NLU)与对话管理(DM)的联合建模。该模型包含三部分。网络底部的长短期记忆(LSTM)将每个对话轮次中的话语编码为轮次嵌入。对话嵌入由网络中部的 LSTM 学习,并通过输入所有轮次嵌入进行更新。顶部是一个前向深度神经网络,将对话嵌入转换为不同对话动作的 Q 值。基于级联 LSTM 的强化学习网络通过利用每轮对话所获得的奖励作为唯一监督信息进行联合优化。网络中不存在显式的 NLU 与对话状态。实验结果表明,我们的模型在会议室预订任务上优于传统的马尔可夫决策过程(MDP)模型以及带有深度 Q 网络(DQN)的单 LSTM。对话嵌入的可视化表明,该模型能够学习对话状态的表示。
引用
@article{arxiv.1910.14229,
title = {Cascaded LSTMs based Deep Reinforcement Learning for Goal-driven Dialogue},
author = {Yue Ma and Xiaojie Wang and Zhenjiang Dong and Hong Chen},
journal= {arXiv preprint arXiv:1910.14229},
year = {2019}
}
备注
12 pages, 3 figures, appear in NLPCC 2017