标签同步与帧同步端到端语音识别模型的比较
音频与语音处理
2020-05-26 v2 计算与语言
声音
摘要
端到端模型在自动语音识别(ASR)领域正获得广泛关注。其优势之一在于构建简便,可直接通过神经网络将语音帧序列识别为文本标签序列。依据识别过程中的驱动端,端到端 ASR 模型可分为两类:标签同步与帧同步,二者各具独特的模型行为与特性。本文对一个代表性的标签同步模型(transformer)与一个软帧同步模型(基于连续积分触发(CIF)的模型)进行了详细比较。在三个公开数据集及一个含 12000 小时训练数据的大规模数据集上的结果表明,两类模型各有与其同步模式一致的优势。
引用
@article{arxiv.2005.10113,
title = {A Comparison of Label-Synchronous and Frame-Synchronous End-to-End Models for Speech Recognition},
author = {Linhao Dong and Cheng Yi and Jianzong Wang and Shiyu Zhou and Shuang Xu and Xueli Jia and Bo Xu},
journal= {arXiv preprint arXiv:2005.10113},
year = {2020}
}
备注
4 pages, 2 figures