中文

基于 R-Drop 结构的改进 Conformer 端到端语音识别模型研究

声音 2023-06-16 v1 计算与语言 音频与语音处理

摘要

针对深度学习中端到端语音识别模型泛化能力较差的问题,本研究提出了一种结合 R-drop 结构的、基于 Conformer 的新型语音识别模型“Conformer-R”。该模型将已在语音识别中展现出良好效果的 Conformer 模型与 R-drop 结构相结合。借此,模型能够有效建模局部与全局语音信息,同时通过 R-drop 结构降低过拟合,从而增强模型泛化能力并提高整体识别效率。该模型首先在 Aishell1 和 Wenetspeech 数据集上进行预训练以实现通用领域自适应,随后在计算机相关音频数据上微调。在相同测试集上与 LAS、Wenet 等经典模型进行对比测试,结果表明 Conformer-R 模型能够有效提升泛化能力。

关键词

引用

@article{arxiv.2306.08329,
  title  = {Research on an improved Conformer end-to-end Speech Recognition Model with R-Drop Structure},
  author = {Weidong Ji and Shijie Zan and Guohui Zhou and Xu Wang},
  journal= {arXiv preprint arXiv:2306.08329},
  year   = {2023}
}

备注

15 pages, 9 figures