中文

用于在线对话状态跟踪的深度强化学习

计算与语言 2020-09-23 v1

摘要

对话状态跟踪(DST)是对话管理中的关键模块。它通常被视为监督训练问题,不便于在线优化。本文提出了一种基于伴随教学(companion teaching)的深度强化学习(DRL)框架,用于在线 DST 优化。据我们所知,这是在 DRL 框架下优化面向任务的口语对话系统中 DST 模块的首次尝试。此外,对话策略可进一步联合更新。实验表明,在线 DST 优化能在保持使用预定义策略灵活性的同时,有效提升对话管理器性能。DST 与策略的联合训练可进一步提升性能。

关键词

引用

@article{arxiv.2009.10321,
  title  = {Deep Reinforcement Learning for On-line Dialogue State Tracking},
  author = {Zhi Chen and Lu Chen and Xiang Zhou and Kai Yu},
  journal= {arXiv preprint arXiv:2009.10321},
  year   = {2020}
}

备注

10 pages, 5 figures