在端到端自动语音识别中利用非尖峰 CTC 改进词时间帧级分类器
音频与语音处理
2023-06-14 v1 人工智能
机器学习
摘要
端到端(E2E)系统在自动语音识别(ASR)上已展现出可与混合系统相媲美的性能。词时间作为 ASR 的副产品,在许多应用中至关重要,尤其对于字幕生成与计算机辅助发音训练。本文通过引入连接时序分类(CTC)损失中的标签先验(采自先前工作),并将低层梅尔尺度滤波器组与高层 ASR 编码器输出拼接作为入特征,改进了 E2E 系统中用于词时间的帧级分类器。在内部中文语料上,所提方法在词时间准确率指标上取得 95.68%/94.18%,而混合系统为 93.0%/90.22%。其在 7 种语言上的指标也超越先前的 E2E 方法,绝对提升达 4.80%/8.02%。此外,我们通过帧级知识蒸馏延迟 CTC 尖峰进一步提升了词时间准确率,尽管仅在 LibriSpeech 上进行了实验。
引用
@article{arxiv.2306.07949,
title = {Improving Frame-level Classifier for Word Timings with Non-peaky CTC in End-to-End Automatic Speech Recognition},
author = {Xianzhao Chen and Yist Y. Lin and Kang Wang and Yi He and Zejun Ma},
journal= {arXiv preprint arXiv:2306.07949},
year = {2023}
}
备注
To appear in the proceedings of INTERSPEECH 2023