在预训练语言模型主干上构建马尔可夫生成架构以实现高效任务型对话系统
计算与语言
2022-10-17 v2 人机交互
摘要
近来,基于 Transformer 的预训练语言模型(PLM),如 GPT2 和 T5,已被用于构建生成式任务型对话(TOD)系统。现有基于 PLM 的模型的一个缺陷是它们在多轮之间采用非马尔可夫架构,即每一轮都将完整历史作为条件输入。首先,这带来了内存与计算上的低效。此外,使用完整历史增加了模型复杂度,并可能损害训练效率,尤其是在面对少量标注训练数据(低资源设定)时。本文中,受对话状态可视为马尔可夫状态的观察启发,我们提出在 PLM 主干上构建马尔可夫生成架构(MGA)以实现高效的 TOD 系统。在 MultiWOZ2.1 上的实验表明,在富资源设定下,所提出的马尔可夫模型在不降低性能的前提下减少了内存与时间开销;在低资源设定下,马尔可夫模型的训练效率提升更为显著。
引用
@article{arxiv.2204.06452,
title = {Building Markovian Generative Architectures over Pretrained LM Backbones for Efficient Task-Oriented Dialog Systems},
author = {Hong Liu and Yucheng Cai and Zhijian Ou and Yi Huang and Junlan Feng},
journal= {arXiv preprint arXiv:2204.06452},
year = {2022}
}
备注
Accepted by SLT 2022