通过自监督语音表示的对应训练改进声学词嵌入
计算与语言
2024-03-14 v1 声音
音频与语音处理
摘要
声学词嵌入(AWE)是口语词的向量表示。获取AWE的一种有效方法是对应自编码器(CAE)。过去,CAE方法通常与传统MFCC特征相关联。从基于自监督学习(SSL)的语音模型(如HuBERT、Wav2vec2等)获得的表示在许多下游任务中表现优于MFCC。然而,它们在AWE学习背景下的研究尚不充分。本工作探索了CAE与基于SSL的语音表示相结合以获得改进AWE的有效性。此外,还探索了基于SSL的语音模型在跨语言场景中获取AWE的能力。实验在五种语言上进行:波兰语、葡萄牙语、西班牙语、法语和英语。基于HuBERT的CAE模型在所有语言的单词辨别中均取得了最佳结果,尽管HuBERT仅在英语上进行了预训练。同时,基于HuBERT的CAE模型在跨语言设置中表现良好。当在一种源语言上训练并在目标语言上测试时,其性能优于在目标语言上训练的基于MFCC的CAE模型。
引用
@article{arxiv.2403.08738,
title = {Improving Acoustic Word Embeddings through Correspondence Training of Self-supervised Speech Representations},
author = {Amit Meghanani and Thomas Hain},
journal= {arXiv preprint arXiv:2403.08738},
year = {2024}
}
备注
Accepted to EACL 2024 Main Conference, Long paper