面向可扩展高效设备端语音识别的迁移学习
计算与语言
2024-07-24 v1 音频与语音处理
摘要
多语言预训练迁移学习显著提升了低资源单语言 ASR 模型的鲁棒性。本研究系统性地探讨了三个主要方面:(a) 迁移学习对模型在初始训练或微调期间性能的影响;(b) 跨数据集域和语言的迁移学习影响;(c) 对罕见词识别相对于非罕见词的影响。我们的发现表明,RNNT-loss 预训练后,再以最小词错误率(MinWER)损失进行单语言微调,能在意大利语、法语等语言上持续降低词错误率(WER)。相对于单语言基线,MLS 和内部数据集的 WER 降低幅度(WERR)分别达到 36.2% 和 42.8%。跨域预训练比同一域预训练的 WERR 高出 28%。罕见词和非罕见词都受益,罕见词在跨域预训练下表现更佳,非罕见词在同一域预训练下获益更大。
引用
@article{arxiv.2407.16664,
title = {Towards scalable efficient on-device ASR with transfer learning},
author = {Laxmi Pandey and Ke Li and Jinxi Guo and Debjyoti Paul and Arthur Guo and Jay Mahadeokar and Xuedong Zhang},
journal= {arXiv preprint arXiv:2407.16664},
year = {2024}
}