中文

基于无标注数据与小尺寸 BERT 模型的不流畅检测

计算与语言 2021-07-28 v2

摘要

不流畅检测模型目前在英文文本上已接近高准确率。然而,在改进模型规模与推理时间方面鲜有探索。与此同时,自动语音识别(ASR)模型正从服务器端推理转向本地、设备端推理。转录流水线中的支撑模型(如不流畅检测)必须随之跟进。在本工作中,我们聚焦于不流畅检测任务,以基于 BERT 架构的小巧、快速、设备端模型为重点。我们证明可以训练出小至 1.3 MiB 的不流畅检测模型,同时保持高性能。我们建立在先前工作之上,该工作展示了自训练等数据增强方法的益处。随后,我们评估了会话文本与书面文本之间领域失配对模型性能的影响。我们发现,与常规 BERT 模型相比,领域自适应与数据增强策略对这些更小模型的影响更为显著。

关键词

引用

@article{arxiv.2104.10769,
  title  = {Disfluency Detection with Unlabeled Data and Small BERT Models},
  author = {Johann C. Rocholl and Vicky Zayats and Daniel D. Walker and Noah B. Murad and Aaron Schneider and Daniel J. Liebling},
  journal= {arXiv preprint arXiv:2104.10769},
  year   = {2021}
}

备注

INTERSPEECH 2021