中文

论外部数据在语音命名实体识别中的使用

计算与语言 2022-07-12 v2 机器学习 声音 音频与语音处理

摘要

语音语言理解(SLU)任务涉及从语音音频信号到语义标签的映射。鉴于此类任务的复杂性,良好的性能可能需要大型标注数据集,而针对每个新任务和领域收集这些数据颇为困难。然而,自监督语音表示的最新进展使得考虑以有限标注数据学习 SLU 模型成为可能。本文关注低资源语音命名实体识别(NER),并探讨如下问题:除自监督预训练外,我们如何利用未针对该任务标注的外部语音和/或文本数据?我们借鉴了多种方法,包括自训练、知识蒸馏和迁移学习,并考察它们对端到端模型以及流水线(先语音识别后文本 NER 模型)方法的适用性。我们发现,在资源受限环境下,其中若干方法相较仅使用预训练表示能进一步提升性能。与先前工作相比,我们的 F1 分数提升了最高达 16%。尽管最佳基线模型为流水线方法,但使用外部数据时的最终最佳性能由端到端模型取得。我们给出了详细的比较与分析,例如表明端到端模型能够聚焦于更具 NER 特异性的词语。

关键词

引用

@article{arxiv.2112.07648,
  title  = {On the Use of External Data for Spoken Named Entity Recognition},
  author = {Ankita Pasad and Felix Wu and Suwon Shon and Karen Livescu and Kyu J. Han},
  journal= {arXiv preprint arXiv:2112.07648},
  year   = {2022}
}

备注

Accepted at NAACL 2022. Codebase available at https://github.com/asappresearch/spoken-ner