基于简化生成架构的联合强化用户模拟器与任务型对话系统
计算与语言
2022-10-14 v1 人工智能
摘要
近来,在监督微调预训练 GPT-2 以构建端到端任务型对话(TOD)系统方面已取得进展。然而,基于 GPT-2 的对话系统(DS)与端到端用户模拟器(US)的在线强化学习尚未被探索。此外,现有基于 GPT-2 的 TOD 系统的一个缺陷是大多将整个对话历史作为输入,这带来了内存与计算上的低效。本文中,我们首先分别为 DS 和 US 提出简化生成架构(SGA),二者均基于 GPT-2 但使用缩短的历史。随后,我们成功开发了联合强化的 US 与 DS,称为 SGA-JRUD。我们所提 SGA 的 DS 在仅经监督训练时,在 MultiWOZ2.1 上达到了最先进性能,且在训练和生成中更具计算效率。在 MultiWOZ2.1 上的大量实验进一步展示了 SGA-JRUD 在离线和在线评估中的优越性。
引用
@article{arxiv.2210.06706,
title = {Jointly Reinforced User Simulator and Task-oriented Dialog System with Simplified Generative Architecture},
author = {Hong Liu and Zhijian Ou and Yi Huang and Junlan Feng},
journal= {arXiv preprint arXiv:2210.06706},
year = {2022}
}
备注
An early version of Markovian Generative Architectures (MGA) and Generative User Simulator (GUS)