中文

基于弱监督的低资源口语理解流水线

计算与语言 2022-06-22 v1

摘要

在弱监督学习(WSL)中,模型在由语义规则和任务特定的预训练模型得到的噪声标签上进行训练。规则在任务上的泛化能力有限且需要大量人工工作,而预训练模型仅可用于有限任务。在本工作中,我们提出利用基于提示(prompt)的方法作为弱来源,在未标注数据上获取噪声标签。我们展示了任务无关的提示具有可泛化性,并可用于为不同的口语理解(SLU)任务(如情感分类、不流畅检测和情绪分类)获取噪声标签。这些提示还可进一步更新以添加任务特定上下文,从而提供设计任务特定提示的灵活性。我们证明了基于提示的方法能为上述 SLU 任务生成可靠标签,因此可作为通用弱来源,在缺乏标注数据时训练弱监督模型(WSM)。我们提出的基于提示弱来源的 WSL 流水线在三个基准 SLU 数据集上,于零样本和少样本学习上的 Macro-F1 均超过其他有竞争力的低资源基准 4% 以上。所提方法在 Macro-F1 上还超过传统的基于规则的 WSL 流水线 5% 以上。

关键词

引用

@article{arxiv.2206.10559,
  title  = {Low Resource Pipeline for Spoken Language Understanding via Weak Supervision},
  author = {Ayush Kumar and Rishabh Kumar Tripathi and Jithendra Vepa},
  journal= {arXiv preprint arXiv:2206.10559},
  year   = {2022}
}