中文

具有自动标点插入的端到端 ASR 系统

计算与语言 2020-12-04 v1 机器学习 声音 音频与语音处理

摘要

近期的自动语音识别系统已转向可联合训练的端到端系统。近期提出的众多技术推动了这一趋势,包括使用 CNN 进行特征提取、使用 RNN 进行上下文捕获与声学特征建模、使用 Connectionist Temporal Classifications 自动对齐输入输出序列,以及用 RNN 语言模型替代传统的 n-gram 语言模型。历史上,在文本或语音转文本情境下的自动标点一直备受关注。然而,将自动标点整合到新兴的基于神经网络的端到端语音识别系统中似乎兴趣寥寥,部分原因是缺乏带标点转录文本的英文语音语料库。在本研究中,我们提出一种利用 ted.com 上可用转录文本为 TEDLIUM 数据集生成带标点转录文本的方法。我们还提出一种从语音信号中同时输出词语和标点的端到端 ASR 系统。通过将 Damerau Levenshtein Distance 与槽错误率结合为 DLev-SER,我们能够在假设文本与参考文本未完美对齐时度量标点错误率。与先前方法相比,我们的模型将槽错误率从 0.497 降至 0.341。

关键词

引用

@article{arxiv.2012.02012,
  title  = {End to End ASR System with Automatic Punctuation Insertion},
  author = {Yushi Guan},
  journal= {arXiv preprint arXiv:2012.02012},
  year   = {2020}
}