中文

SPACE-2:面向任务型对话理解的三树结构半监督对比预训练

计算与语言 2022-09-15 v1

摘要

具有对比学习目标的无监督预训练方法在对话理解任务中取得了显著成功。然而,当前的对比学习仅将自增强的对话样本视为正样本,并将所有其他对话样本视为负样本,这即使对于语义相关的对话也强制了不相似的表示。在本文中,我们提出 SPACE-2,一种树结构预训练对话模型,它通过半监督对比预训练从有限的标注对话和大规模无标注对话语料库中学习对话表示。具体而言,我们首先定义一个通用语义树结构(STS)以统一不同对话数据集间不一致的标注模式,从而可以利用所有标注数据中存储的丰富结构信息。然后我们提出一种新颖的多视图评分函数,在监督对比预训练期间提高所有共享相似 STS 的 possible 对话的相关性,并仅推开其他完全不同的对话。为充分利用无标注对话,还添加了基本的自监督对比损失以细化学习到的表示。实验表明,我们的方法在由七个数据集和四个流行对话理解任务组成的 DialoGLUE 基准上取得了新的最先进结果。为可复现性,我们在 https://github.com/AlibabaResearch/DAMO-ConvAI/tree/main/space-2 发布了代码和数据。

关键词

引用

@article{arxiv.2209.06638,
  title  = {SPACE-2: Tree-Structured Semi-Supervised Contrastive Pre-training for Task-Oriented Dialog Understanding},
  author = {Wanwei He and Yinpei Dai and Binyuan Hui and Min Yang and Zheng Cao and Jianbo Dong and Fei Huang and Luo Si and Yongbin Li},
  journal= {arXiv preprint arXiv:2209.06638},
  year   = {2022}
}

备注

17 pages, 6 figures. Accepted by COLING 2022