中文

SPACE-3:面向任务型对话理解与生成的统一对话模型预训练

计算与语言 2022-09-15 v1

摘要

近年来,预训练方法在任务型对话(TOD)系统中取得了显著成功。然而,现有大多数面向 TOD 的预训练模型仅关注对话理解或对话生成之一,而非两者兼顾。本文提出 SPACE-3,一种新颖的统一半监督预训练对话模型,从大规模对话语料库中借助有限标注进行学习,可有效地在广泛下游对话任务上微调。具体而言,SPACE-3 在单一 transformer 中由四个连续组件构成,以维护 TOD 系统中的任务流:(i) 对话编码模块以编码对话历史,(ii) 对话理解模块以从用户查询或系统回复中提取语义向量,(iii) 对话策略模块以生成包含回复高层语义的策略向量,以及 (iv) 对话生成模块以产生恰当回复。我们为每个组件设计了专门的预训练目标。具体地,我们使用跨度掩码语言建模预训练对话编码模块以学习上下文对话信息。为捕获结构化对话语义,我们借助额外对话标注,通过一种新颖的树诱导半监督对比学习目标预训练对话理解模块。此外,我们通过最小化其输出策略向量与回复语义向量之间的 L2 距离来预训练对话策略模块以进行策略优化。最后,对话生成模型通过语言建模进行预训练。结果表明,SPACE-3 在八个下游对话基准(包括意图预测、对话状态跟踪和端到端对话建模)上取得了最先进的性能。我们还表明,在低资源设置下 SPACE-3 比现有模型具有更强的少样本能力。

关键词

引用

@article{arxiv.2209.06664,
  title  = {SPACE-3: Unified Dialog Model Pre-training for Task-Oriented Dialog Understanding and Generation},
  author = {Wanwei He and Yinpei Dai and Min Yang and Jian Sun and Fei Huang and Luo Si and Yongbin Li},
  journal= {arXiv preprint arXiv:2209.06664},
  year   = {2022}
}

备注

14 pages, 5 figures. Accepted by SIGIR 2022