中文

面向可扩展高效设备端语音识别的迁移学习

计算与语言 2024-07-24 v1 音频与语音处理

摘要

多语言预训练迁移学习显著提升了低资源单语言 ASR 模型的鲁棒性。本研究系统性地探讨了三个主要方面:(a) 迁移学习对模型在初始训练或微调期间性能的影响;(b) 跨数据集域和语言的迁移学习影响;(c) 对罕见词识别相对于非罕见词的影响。我们的发现表明,RNNT-loss 预训练后,再以最小词错误率(MinWER)损失进行单语言微调,能在意大利语、法语等语言上持续降低词错误率(WER)。相对于单语言基线,MLS 和内部数据集的 WER 降低幅度(WERR)分别达到 36.2% 和 42.8%。跨域预训练比同一域预训练的 WERR 高出 28%。罕见词和非罕见词都受益,罕见词在跨域预训练下表现更佳,非罕见词在同一域预训练下获益更大。

关键词

引用

@article{arxiv.2407.16664,
  title  = {Towards scalable efficient on-device ASR with transfer learning},
  author = {Laxmi Pandey and Ke Li and Jinxi Guo and Debjyoti Paul and Arthur Guo and Jay Mahadeokar and Xuedong Zhang},
  journal= {arXiv preprint arXiv:2407.16664},
  year   = {2024}
}