面向端到端语音识别的声学数据驱动子词建模
计算与语言
2023-10-24 v4
摘要
子词单元常用于端到端自动语音识别(ASR),而一种完全声学导向的子词建模方法尚有所缺失。我们提出一种声学数据驱动子词建模(ADSM)方法,将若干基于文本与基于声学的子词方法的优势整合入统一流程。借助完全声学导向的标签设计与学习过程,ADSM 生成声学结构化的子词单元与声学匹配的目标序列,以供后续 ASR 训练。所获 ADSM 标签通过不同端到端 ASR 方法评估,包括 CTC、RNN-Transducer 与注意力模型。在 LibriSpeech 语料上的实验表明,ADSM 在所有情形下均明显优于字节对编码(BPE)与发音辅助子词建模(PASM)。详细分析显示,ADSM 实现了声学上更合理的词分割与更均衡的序列长度,因而适用于时间同步与标签同步模型。我们还简要描述了如何应用基于声学的子词正则化及利用 ADSM 进行未登录文本分割。
引用
@article{arxiv.2104.09106,
title = {Acoustic Data-Driven Subword Modeling for End-to-End Speech Recognition},
author = {Wei Zhou and Mohammad Zeineldeen and Zuoyun Zheng and Ralf Schlüter and Hermann Ney},
journal= {arXiv preprint arXiv:2104.09106},
year = {2023}
}
备注
accepted at Interspeech2021