中文

在端到端自动语音识别中利用非尖峰 CTC 改进词时间帧级分类器

音频与语音处理 2023-06-14 v1 人工智能 机器学习

摘要

端到端(E2E)系统在自动语音识别(ASR)上已展现出可与混合系统相媲美的性能。词时间作为 ASR 的副产品,在许多应用中至关重要,尤其对于字幕生成与计算机辅助发音训练。本文通过引入连接时序分类(CTC)损失中的标签先验(采自先前工作),并将低层梅尔尺度滤波器组与高层 ASR 编码器输出拼接作为入特征,改进了 E2E 系统中用于词时间的帧级分类器。在内部中文语料上,所提方法在词时间准确率指标上取得 95.68%/94.18%,而混合系统为 93.0%/90.22%。其在 7 种语言上的指标也超越先前的 E2E 方法,绝对提升达 4.80%/8.02%。此外,我们通过帧级知识蒸馏延迟 CTC 尖峰进一步提升了词时间准确率,尽管仅在 LibriSpeech 上进行了实验。

关键词

引用

@article{arxiv.2306.07949,
  title  = {Improving Frame-level Classifier for Word Timings with Non-peaky CTC in End-to-End Automatic Speech Recognition},
  author = {Xianzhao Chen and Yist Y. Lin and Kang Wang and Yi He and Zejun Ma},
  journal= {arXiv preprint arXiv:2306.07949},
  year   = {2023}
}

备注

To appear in the proceedings of INTERSPEECH 2023