中文

利用感知同化模型与前沿声学模型预测非母语语音感知

计算与语言 2022-06-01 v1 声音 音频与语音处理

摘要

我们的母语影响我们感知语音声音的方式,影响我们区分非母语声音的能力。我们比较了关于母语对语音感知影响的两种观点:感知同化模型(Perceptual Assimilation Model),其诉诸于将声音在心理上进行母语音素类别的分类; versus 这样一种观点,即调谐于母语统计的丰富、细粒度语音表征已足够。我们使用来自两个前沿语音模型的表征来操作化这一观点:一个 Dirichlet 过程高斯混合模型以及较新的 wav2vec 2.0 模型。我们提出了一个新的开放数据集,包含法语和英语参与者对来自六种语言的 61 个元音声音的语音感知行为。我们表明,无论对于整体区分行为,还是预测与母语背景差异相关的可区分性差异,音素同化都是比细粒度语音建模更好的预测因子。我们还表明,wav2vec 2.0 虽然不擅长捕捉母语对语音感知的影响,却与母语音素同化信息互补,并提供了低层语音表征的良好模型,支持了语音感知中同时使用类别化和细粒度感知的观点。

关键词

引用

@article{arxiv.2205.15823,
  title  = {Predicting non-native speech perception using the Perceptual Assimilation Model and state-of-the-art acoustic models},
  author = {Juliette Millet and Ioana Chitoran and Ewan Dunbar},
  journal= {arXiv preprint arXiv:2205.15823},
  year   = {2022}
}