用于在线对话状态跟踪的深度强化学习
计算与语言
2020-09-23 v1
摘要
对话状态跟踪(DST)是对话管理中的关键模块。它通常被视为监督训练问题,不便于在线优化。本文提出了一种基于伴随教学(companion teaching)的深度强化学习(DRL)框架,用于在线 DST 优化。据我们所知,这是在 DRL 框架下优化面向任务的口语对话系统中 DST 模块的首次尝试。此外,对话策略可进一步联合更新。实验表明,在线 DST 优化能在保持使用预定义策略灵活性的同时,有效提升对话管理器性能。DST 与策略的联合训练可进一步提升性能。
引用
@article{arxiv.2009.10321,
title = {Deep Reinforcement Learning for On-line Dialogue State Tracking},
author = {Zhi Chen and Lu Chen and Xiang Zhou and Kai Yu},
journal= {arXiv preprint arXiv:2009.10321},
year = {2020}
}
备注
10 pages, 5 figures