基于字母 vs. 基于音素的标签单元用于编码器-解码器-注意力模型的系统比较
音频与语音处理
2021-04-16 v3 计算与语言
机器学习
神经与进化计算
摘要
遵循端到端建模思路,用于自动语音识别(ASR)的 CTC、RNN-T 或编码器-解码器-注意力模型使用字母或基于字母的子词单元(例如基于字节对编码(BPE))。从发音到拼写的映射完全从数据中学习。与此相反,经典 ASR 方法采用音素列表形式的辅助知识源来定义语音输出标签与发音词典。本文中,我们对编码器-解码器-注意力 ASR 模型的字母基与音素基输出标签进行系统比较。我们考察了以单个音素及基于 BPE 的音素组作为模型输出标签的用途。为保持简化且高效的解码器设计,我们还扩展了音素集并加入辅助单元以区分同音词。在 Switchboard 300h 与 LibriSpeech 基准上的实验表明,音素基建模可与字母基编码器-解码器-注意力建模相媲美。
引用
@article{arxiv.2005.09336,
title = {A systematic comparison of grapheme-based vs. phoneme-based label units for encoder-decoder-attention models},
author = {Mohammad Zeineldeen and Albert Zeyer and Wei Zhou and Thomas Ng and Ralf Schlüter and Hermann Ney},
journal= {arXiv preprint arXiv:2005.09336},
year = {2021}
}
备注
5 pages, 6 tables