中文

基于混合 CTC/Attention 架构与多特征融合网络探索土耳其语语音识别

声音 2023-03-23 v1 计算与语言 音频与语音处理

摘要

近年来,基于深度学习的端到端语音识别技术发展迅速。由于土耳其语语音数据匮乏,土耳其语语音识别系统性能较差。首先,本文研究了一系列语音识别调优技术。结果表明,当采用速度扰动与加噪结合的数据增强技术且束搜索宽度设为 16 时,模型性能最佳。其次,为最大化利用有效特征信息并提升特征提取准确率,本文提出一种新的特征提取器 LSPC。LSPC 与 LiGRU 网络结合形成共享编码器结构,并实现模型压缩。结果表明,仅使用 Fbank 特征时,LSPC 性能优于 MSPC 和 VGGnet,词错率(WER)分别提升 1.01% 和 2.53%。最后,基于上述两点,提出一种新的多特征融合网络作为编码器主体结构。结果表明,基于 LSPC 的所提特征融合网络相比使用 LSPC 的单特征(Fbank 特征与 Spectrogram 特征)提取,词错率再次提升 0.82% 和 1.94%。我们的模型取得了与先进端到端模型相当的性能。

关键词

引用

@article{arxiv.2303.12300,
  title  = {Exploring Turkish Speech Recognition via Hybrid CTC/Attention Architecture and Multi-feature Fusion Network},
  author = {Zeyu Ren and Nurmement Yolwas and Huiru Wang and Wushour Slamu},
  journal= {arXiv preprint arXiv:2303.12300},
  year   = {2023}
}