带时间戳的嵌入匹配声学到词CTC语音识别
计算与语言
2023-06-21 v1 音频与语音处理
摘要
在本文中,我们描述了一种训练嵌入匹配词级连接时序分类(CTC)自动语音识别器(ASR)的新方法,使其在输出转录文本的同时,直接产生许多实际应用所需的词开始时间与持续时间。词时间戳使得ASR在测试时无需依赖辅助模型或强制对齐过程即可输出词分割与词混淆网络。我们提出的系统具有与混合DNN-HMM(深度神经网络-隐马尔可夫模型)系统相近的词分割准确度,在TIMIT数据上词开始时间的平均绝对误差差异小于3ms。同时,我们观察到在使用相同音频训练数据和几乎相同的模型大小时,与非时间戳系统相比,词错误率的相对增加低于5%。我们还对多假设嵌入匹配ASR进行了更为严谨的一般性分析。
引用
@article{arxiv.2306.11473,
title = {Timestamped Embedding-Matching Acoustic-to-Word CTC ASR},
author = {Woojay Jeon},
journal= {arXiv preprint arXiv:2306.11473},
year = {2023}
}