中文

后处理网络:基于强化学习优化流水线式任务型对话系统的方法

计算与语言 2022-07-26 v1 人工智能

摘要

许多研究提出通过强化学习联合训练系统各模块,以优化整个流水线式任务型对话系统的对话性能。然而,这些方法存在局限:仅适用于以可训练神经方法实现的模块。为解决该问题,我们提出一种以任意方法实现的模块组成的流水线系统的对话性能优化方法。该方法在系统内安装称为后处理网络(PPN)的神经组件,对各模块输出进行后处理。所有PPN均通过强化学习更新以提升系统整体对话性能,无需各模块可微。通过在MultiWOZ数据集上的对话模拟与人类评估,我们表明该方法可改善由多种模块构成的流水线系统的对话性能。

关键词

引用

@article{arxiv.2207.12185,
  title  = {Post-processing Networks: Method for Optimizing Pipeline Task-oriented Dialogue Systems using Reinforcement Learning},
  author = {Atsumoto Ohashi and Ryuichiro Higashinaka},
  journal= {arXiv preprint arXiv:2207.12185},
  year   = {2022}
}

备注

Accepted by SIGDIAL 2022