中文

基于 Conformer 的语音识别中噪声鲁棒性的模块化研究

音频与语音处理 2024-09-10 v1

摘要

尽管 SOTA 自动语音识别 (ASR) 表现良好,但在暴露于与训练模型时所用环境不同的声学环境时,其性能仍会下降。对于给定模型而言,陌生的环境可能已被先验知晓,但只能产生相对少量的自适应数据。在这项实验研究中,我们探讨了模块化的最新形式化在多大程度上可以帮助 ASR 自适应到新的声学环境。使用基于 Conformer 的模型和固定路由,我们证实了环境感知确实可以在已知环境中带来性能提升。然而,至少在本研究使用的 (CHIME) 数据集上,分类器模块很难区分不同的噪声环境,区分噪声语音和纯净语音这种更简单的划分才是最佳配置。这些结果对于在有或没有环境噪声先验知识的情况下,在特定环境中部署大型模型具有明确的指导意义。

关键词

引用

@article{arxiv.2409.05589,
  title  = {An investigation of modularity for noise robustness in conformer-based ASR},
  author = {Louise Coppieters de Gibson and Philip N. Garner and Pierre-Edouard Honnet},
  journal= {arXiv preprint arXiv:2409.05589},
  year   = {2024}
}

备注

5 pages, 3 figures