自监督预训练模型集成特征用于自动语音识别的研究
计算与语言
2023-02-21 v1 音频与语音处理
摘要
基于自监督学习(SSL)的模型已被证明能够生成强大的表示,可用于提升下游语音任务的性能。现有若干最先进的 SSL 模型,每个模型优化不同的损失,这使得它们的特征有可能互补。本文提出使用此类 SSL 表示与模型的集成,以利用各预训练模型所提取特征的互补性。我们假设这会带来更丰富的特征表示,并给出了在 ASR 下游任务上的结果。为此,我们使用了在 ASR 任务上表现出色的三个 SSL 模型,即 HuBERT、Wav2vec2.0 和 WaveLM。我们探索了为 ASR 任务微调的模型集成,以及利用从预训练模型获得的嵌入用于下游 ASR 任务的特征集成。在 Librispeech(100h) 和 WSJ 数据集的下游任务上,相较于单个模型和预训练特征,我们获得了性能提升。
引用
@article{arxiv.2206.05518,
title = {Investigation of Ensemble features of Self-Supervised Pretrained Models for Automatic Speech Recognition},
author = {A Arunkumar and Vrunda N Sukhadia and S. Umesh},
journal= {arXiv preprint arXiv:2206.05518},
year = {2023}
}
备注
4 pages , 2 figures,submitted to interspeech 2022