面向大域对话管理的封建强化学习
计算与语言
2018-03-09 v1 人工智能
神经与进化计算
摘要
强化学习(RL)是解决对话策略优化的一种有前景的方法。然而,传统 RL 算法由于维度灾难而无法扩展到大型域。我们提出一种基于封建 RL 的新型对话管理架构,其将决策分解为两步:第一步由主策略选择基本动作的一个子集,第二步从该选定子集中选取一个基本动作。域本体中包含的结构信息被用于抽象对话状态空间,在每一步使用抽象状态的不同部分进行决策。这一点与槽位间的信息共享机制相结合,提升了对大型域的可扩展性。我们展示基于 Deep-Q Networks 的该方法实现在多个对话域与环境中显著优于先前最优方法,且不需要任何额外奖励信号。
引用
@article{arxiv.1803.03232,
title = {Feudal Reinforcement Learning for Dialogue Management in Large Domains},
author = {Iñigo Casanueva and Paweł Budzianowski and Pei-Hao Su and Stefan Ultes and Lina Rojas-Barahona and Bo-Hsiang Tseng and Milica Gašić},
journal= {arXiv preprint arXiv:1803.03232},
year = {2018}
}
备注
Accepted as a short paper in NAACL 2018