中文

无监督语音表示中音素、语言与说话人信息的探查

音频与语音处理 2023-06-02 v1 声音

摘要

基于对比预测编码(CPC)[1] 的无监督表示模型主要用于口语语言建模,因其编码了语音信息。本研究中,我们探究 CPC 语音表示中还包含哪些其他类型的信息。我们聚焦于三类:音素类、性别与语言,并比较单语与双语模型。借助定性与定量工具,我们发现性别与音素类信息在两类模型中均存在。然而,语言信息仅在双语模型中非常显著,表明 CPC 模型在多种语言上训练时会学习区分语言。单语模型中也可检索出部分语言信息,但其更分散于所有特征中。当分析来自下游聚类模型的离散单元时,这些模式依然成立。不过,尽管目标聚类数对音素类与语言信息无影响,但更多性别信息随聚类数增多而被编码。最后,我们发现,在下游音素判别任务中,接触两种语言会带来一定代价。

关键词

引用

@article{arxiv.2203.16193,
  title  = {Probing phoneme, language and speaker information in unsupervised speech representations},
  author = {Maureen de Seyssel and Marvin Lavechin and Yossi Adi and Emmanuel Dupoux and Guillaume Wisniewski},
  journal= {arXiv preprint arXiv:2203.16193},
  year   = {2023}
}

备注

Submitted to INTERSPEECH 2022, 5 pages, 2 figures