大型预训练模型在低资源自动语音识别中的高效利用
音频与语音处理
2023-08-21 v3 计算与语言
机器学习
声音
摘要
无监督表示学习近来帮助自动语音识别(ASR)应对标注数据有限的任务。此后,硬件限制与应用场景引出了如何高效利用大型预训练模型并降低其复杂度的问题。本工作中,我们研究来自医疗领域的越南语和德语低资源对话式电话语音语料这一挑战性任务。我们展示了在无监督技术上超越简单微调大型预训练模型的收益,讨论了如何将其适配到实际电话语音任务(包括带宽迁移),并探究了预训练与微调的不同数据条件。我们使用预训练技术相对项目基线提升了22%的性能。通过架构与训练的改进可进一步获得29%的提升,而加入0.8小时领域内自适应数据可带来6%的提升。
引用
@article{arxiv.2210.15445,
title = {Efficient Utilization of Large Pre-Trained Models for Low Resource ASR},
author = {Peter Vieting and Christoph Lüscher and Julian Dierkes and Ralf Schlüter and Hermann Ney},
journal= {arXiv preprint arXiv:2210.15445},
year = {2023}
}
备注
Accepted at ICASSP SASB 2023