基于预训练自监督语音模型的声学词嵌入分析
计算与语言
2023-03-16 v2 声音
音频与语音处理
摘要
鉴于自监督模型在各种任务上的强劲表现,探索用于声学词嵌入(AWE,即表示变长口语词段的固定维向量)的自监督表示的研究少得令人惊讶。在本工作中,我们研究了几种预训练模型及池化方法,以利用自监督表示构建AWE。由于自监督表示的上下文相关特性,我们假设简单池化方法(如平均)可能已足以用于构建AWE。在标准的词判别任务上评估时,我们发现采用均值池化的HuBERT表示在英语AWE上可与最先进水平媲美。更令人惊讶的是,尽管仅在英语上训练,HuBERT表示在Xitsonga、普通话和法语上的评估一致优于多语言模型XLSR-53(以及在英语上训练的Wav2Vec 2.0)。
引用
@article{arxiv.2210.16043,
title = {Analyzing Acoustic Word Embeddings from Pre-trained Self-supervised Speech Models},
author = {Ramon Sanabria and Hao Tang and Sharon Goldwater},
journal= {arXiv preprint arXiv:2210.16043},
year = {2023}
}
备注
Accepted to IEEE ICASSP 2023