面向口语语言理解的联合文本与标签生成
计算与语言
2021-05-12 v1 机器学习
摘要
泛化是机器学习中的核心问题,尤其在数据有限时。利用先验信息施加约束是促使泛化的原则性途径。本工作中,我们提出借助预训练语言模型(LM)中嵌入的先验信息,以改进在有限训练数据下意图分类与槽位标注任务的泛化能力。具体而言,我们以合成数据的形式从预训练 LM 中提取先验知识,其隐式编码了先验。我们对 LM 进行微调以生成一种增强语言,其不仅包含文本,还编码了意图标签与槽位标签。所生成的合成数据可后续用于训练分类器。由于生成数据可能含噪,我们将从生成数据学习重新表述为带噪标签学习。随后我们为分类器采用 mixout 正则化,并证明其在抵御生成数据中标签噪声方面的有效性。在实证上,我们的方法展现出优越性能,并以较大幅度超越基线。
引用
@article{arxiv.2105.05052,
title = {Joint Text and Label Generation for Spoken Language Understanding},
author = {Yang Li and Ben Athiwaratkun and Cicero Nogueira dos Santos and Bing Xiang},
journal= {arXiv preprint arXiv:2105.05052},
year = {2021}
}