中文

面向医疗 ASR 的标点与大小写恢复的鲁棒预测

计算与语言 2020-07-14 v2 声音 音频与语音处理

摘要

医疗领域的自动语音识别(ASR)系统专注于转录临床口述和医患对话,由于领域复杂性常带来诸多挑战。ASR 输出通常经过自动标点处理,使用户能够自然说话,而无需说出“句号”、“加逗号”或“感叹号”等笨拙且明确的标点指令,同时大小写恢复可提升用户可读性并改善下游 NLP 任务的性能。本文提出一种利用 BERT、BioBERT 和 RoBERTa 等预训练掩码语言模型进行标点和大小写恢复的条件联合建模框架。我们还提出了通过用医疗领域数据微调掩码语言模型来实现领域与任务特定自适应的技术。最后,我们通过数据增强提升了模型对 ASR 中常见错误的鲁棒性。在口述和对话风格语料库上的实验表明,相较于基线模型,我们提出的模型在真实文本上取得约 5% 的绝对提升,在 ASR 输出上取得约 10% 的提升(基于 F1 指标)。

关键词

引用

@article{arxiv.2007.02025,
  title  = {Robust Prediction of Punctuation and Truecasing for Medical ASR},
  author = {Monica Sunkara and Srikanth Ronanki and Kalpit Dixit and Sravan Bodapati and Katrin Kirchhoff},
  journal= {arXiv preprint arXiv:2007.02025},
  year   = {2020}
}

备注

Accepted for ACL NLPMC workshop 2020