中文

自监督语音模型是否发展出类人的感知偏差?

计算与语言 2022-06-01 v1 声音 音频与语音处理

摘要

用于语音处理的自监督模型在不使用任何外部标签的情况下形成表示空间。日益明显的是,它们至少是部分消除昂贵人工标注的可行途径,这对于低资源语言而言是尤为受关注的问题。但这些模型构建了何种表示空间?人类感知会特化于听者母语的语音。自监督模型中是否发生同样的情况?我们考察了三类最先进自监督模型的表示空间:wav2vec 2.0、HuBERT 和对比预测编码(CPC),并将它们与讲法语和讲英语的人类听者的感知空间进行比较,既在全局上,也考虑到两个语言群体之间的行为差异。我们表明CPC模型显示出微小的母语效应,而wav2vec 2.0和HuBERT似乎发展出非语言特定的通用语音感知空间。与有监督音素识别器预测的比较表明,三种自监督模型都捕捉了相对细粒度的感知现象,而有监督模型更善于捕捉听者母语在感知上较粗粒度、音素层级的影响。

关键词

引用

@article{arxiv.2205.15819,
  title  = {Do self-supervised speech models develop human-like perception biases?},
  author = {Juliette Millet and Ewan Dunbar},
  journal= {arXiv preprint arXiv:2205.15819},
  year   = {2022}
}