中文

面向口语语言理解的联合文本与标签生成

计算与语言 2021-05-12 v1 机器学习

摘要

泛化是机器学习中的核心问题,尤其在数据有限时。利用先验信息施加约束是促使泛化的原则性途径。本工作中,我们提出借助预训练语言模型(LM)中嵌入的先验信息,以改进在有限训练数据下意图分类与槽位标注任务的泛化能力。具体而言,我们以合成数据的形式从预训练 LM 中提取先验知识,其隐式编码了先验。我们对 LM 进行微调以生成一种增强语言,其不仅包含文本,还编码了意图标签与槽位标签。所生成的合成数据可后续用于训练分类器。由于生成数据可能含噪,我们将从生成数据学习重新表述为带噪标签学习。随后我们为分类器采用 mixout 正则化,并证明其在抵御生成数据中标签噪声方面的有效性。在实证上,我们的方法展现出优越性能,并以较大幅度超越基线。

关键词

引用

@article{arxiv.2105.05052,
  title  = {Joint Text and Label Generation for Spoken Language Understanding},
  author = {Yang Li and Ben Athiwaratkun and Cicero Nogueira dos Santos and Bing Xiang},
  journal= {arXiv preprint arXiv:2105.05052},
  year   = {2021}
}