中文

探究自监督语音表征中的音系学:以口音感知为例的案例研究

声音 2025-06-25 v1 计算与语言 音频与语音处理

摘要

传统的口音感知模型低估了听者用于口音判断的音系特征中的梯度变化作用。我们研究了当前语音自监督学习 (SSL) 模型的预训练表征如何编码影响音段口音感知的音系特征级变化。我们关注三个音段:唇齿近音、卷舌闪音和卷舌塞音,这些音段在印地语母语者以及印度次大陆其他语言的英语母语者中被统一产生。我们使用 CSLU 外国口音英语语料库 (Lander, 2007),利用 Phonet (Vásquez-Correa et al., 2019) 以及来自 Wav2Vec2-BERT (Barrault et al., 2023) 和 WavLM (Chen et al., 2022) 的预训练表征,结合美国英语母语者的口音判断,为这些音段提取音系特征概率。探测分析表明,口音强度可以由该音段预训练表征特征的子集得到最佳预测,在该子集中,对比预期美国英语与实际实现的非母语英语音段的感知显著音系特征被赋予了突出权重。基于预训练表征的音段距离(相对于美国英语和印度英语基线)对口音评级进行多项逻辑回归,揭示了口音强度的几率与距基线的距离之间存在符合预期方向的强关联。这些结果突显了自监督语音表征在使用可解释音系特征建模口音感知方面的价值。

关键词

引用

@article{arxiv.2506.17542,
  title  = {Probing for Phonology in Self-Supervised Speech Representations: A Case Study on Accent Perception},
  author = {Nitin Venkateswaran and Kevin Tang and Ratree Wayland},
  journal= {arXiv preprint arXiv:2506.17542},
  year   = {2025}
}