面向自动语音识别的多阶段多模态预训练
计算与语言
2024-04-01 v1 人工智能
摘要
机器学习的最新进展表明,与随机初始化的模型相比,多模态预训练可以提升自动语音识别(ASR)的性能,即使模型仅在单模态任务上进行微调也是如此。现有的用于 ASR 任务的多模态预训练方法主要集中于单阶段预训练,即使用单个无监督任务进行预训练,然后在下游任务上进行微调。在这项工作中,我们引入了一种新颖的方法,将多模态和多任务无监督预训练与基于翻译的有监督中间训练方法相结合。我们通过实验证明,这种多阶段方法在 Librispeech 和 SUPERB 数据集上,相对于基线模型,词错误率(WER)相对改进高达 38.45%。此外,我们还分享了关于选择预训练方法和数据集的若干重要发现。
引用
@article{arxiv.2403.19822,
title = {Multi-Stage Multi-Modal Pre-Training for Automatic Speech Recognition},
author = {Yash Jain and David Chan and Pranav Dheram and Aparna Khare and Olabanji Shonibare and Venkatesh Ravichandran and Shalini Ghosh},
journal= {arXiv preprint arXiv:2403.19822},
year = {2024}
}
备注
Accepted in LREC-COLING 2024 - The 2024 Joint International Conference on Computational Linguistics, Language Resources and Evaluation