中文

自监督语音模型中预训练语言、语音、声调和说话人信息之间关系的分析

计算与语言 2025-06-13 v1 音频与语音处理

摘要

对自监督语音模型的分析已经开始揭示它们在不同位置以及如何表示不同类型的信息。然而,几乎所有的分析都集中在英语上。在这里,我们研究了在四种不同语言上训练的wav2vec2模型如何编码语言匹配和非匹配的语音。我们使用探针分类器和几何分析来检查音素、词汇声调和说话人信息是如何表示的。我们表明,对于所有预训练和测试语言,编码音素、声调和说话人的子空间在很大程度上是正交的,并且逐层的探针准确率模式相似,在较深层中,匹配语言的音素和声调(而非说话人)探针具有相对较小的优势。我们的发现表明,wav2vec2学习到的表示结构在很大程度上独立于预训练期间使用的语音材料。

关键词

引用

@article{arxiv.2506.10855,
  title  = {Analyzing the relationships between pretraining language, phonetic, tonal, and speaker information in self-supervised speech models},
  author = {Michele Gubian and Ioana Krehan and Oli Liu and James Kirby and Sharon Goldwater},
  journal= {arXiv preprint arXiv:2506.10855},
  year   = {2025}
}