面向基于强化学习的任务型对话管理的基准测试环境
机器学习
2018-04-09 v2 计算与语言
神经与进化计算
摘要
对话助手正迅速成为不可或缺的日用辅助工具。为避免手工设计所需对话流程的巨大工作量,可将对话管理(DM)模块建模为连续马尔可夫决策过程(MDP)并通过强化学习(RL)进行训练。近年来已研究多种 RL 模型。然而,缺乏通用基准框架使得难以对不同模型及其泛化到不同环境的能力进行公平比较。因此,本文提出一组具有挑战性的模拟环境,用于对话模型的开发与评估。为提供基线,我们研究若干代表性参数化算法,即深度强化学习算法——DQN、A2C 和自然 Actor-Critic,并将它们与非参数模型 GP-SARSA 进行比较。环境与策略模型均使用公开可用的 PyDial 工具包实现并在线发布,以建立进一步实验的测试床框架并促进实验可复现性。
引用
@article{arxiv.1711.11023,
title = {A Benchmarking Environment for Reinforcement Learning Based Task Oriented Dialogue Management},
author = {Iñigo Casanueva and Paweł Budzianowski and Pei-Hao Su and Nikola Mrkšić and Tsung-Hsien Wen and Stefan Ultes and Lina Rojas-Barahona and Steve Young and Milica Gašić},
journal= {arXiv preprint arXiv:1711.11023},
year = {2018}
}
备注
Accepted at the Deep Reinforcement Learning Symposium, 31st Conference on Neural Information Processing Systems (NIPS 2017) Paper updated with minor changes