用于标点预测的判别性自训练
计算与语言
2021-09-02 v2
摘要
自动语音识别(ASR)输出转录文本的标点预测对于提升ASR转录文本的可读性以及改善下游自然语言处理应用的性能起着关键作用。然而,在标点预测上取得良好性能通常需要大量标注的语音转录文本,这昂贵且费力。在本文中,我们提出一种具有加权损失与判别性标签平滑的判别性自训练方法,以利用未标注的语音转录文本。在英文IWSLT2011基准测试集与一份内部中文口语数据集上的实验结果表明,所提方法相比包括BERT、RoBERTa和ELECTRA模型在内的强基线在标点预测准确率上取得了显著提升。所提出的判别性自训练方法优于朴素自训练方法。我们在IWSLT2011测试集上建立了新的最先进水平(SOTA),以F上1.3%的绝对增益优于当前SOTA模型。
引用
@article{arxiv.2104.10339,
title = {Discriminative Self-training for Punctuation Prediction},
author = {Qian Chen and Wen Wang and Mengzhe Chen and Qinglin Zhang},
journal= {arXiv preprint arXiv:2104.10339},
year = {2021}
}
备注
Accepted by INTERSPEECH 2021