中文

端到端 ASR 中类别特征的集成

计算与语言 2021-10-08 v1 声音 音频与语音处理

摘要

全神经、端到端 ASR 系统迅速引起了语音识别界的兴趣。此类系统使用单一可训练神经网络模型将语音输入转换为文本单元。E2E 模型需要大量配对的语音文本数据,而获取这些数据成本高昂。不同语言和方言可用的数据量各异。充分利用所有这些数据至关重要,以便低资源语言和高资源语言都能得到改进。当我们希望为新的应用领域部署 ASR 系统时,特定领域的训练数据量非常有限。能够利用现有领域的数据对于新领域中的 ASR 准确率十分重要。在本文中,我们将所有这些方面视为 ASR 系统中的类别信息,并提出了一种简单而有效的方式将类别特征集成到 E2E 模型中。我们对各种训练策略进行了详细分析,发现构建包含类别特征的联合模型可比多个独立训练的模型更准确。

关键词

引用

@article{arxiv.2110.03047,
  title  = {Integrating Categorical Features in End-to-End ASR},
  author = {Rongqing Huang},
  journal= {arXiv preprint arXiv:2110.03047},
  year   = {2021}
}

备注

Submitted to ICASSP 2022