神经语音识别模型对语音同化现象的感知
计算与语言
2024-06-24 v1
摘要
人类听者在语音感知过程中能够毫不费力地补偿语音变化,通常无意识地推断出意图表达的音素。例如,当听到“clea[m] pan”这样的语句时,听者会推断出底层的/n/,其中[m]是由于后续唇音[p]的发音部位同化而产生的。本文探讨了神经语音识别模型Wav2Vec2如何感知同化音,并识别了该模型在自动语音识别(ASR)过程中用于补偿同化现象所实现的 linguistic 知识。利用心理语言学刺激,我们系统地分析了各种语言语境线索如何影响模型输出中的补偿模式。作为这些行为实验的补充,我们的探测实验表明,模型在其最终层将其对同化音的解释从声学形式转变为底层形式。最后,我们的因果干预实验表明,模型依赖最少的音系语境线索来完成这种转变。这些发现代表着向更好地理解神经ASR模型与人类在音系处理方面的异同迈出了一步。
引用
@article{arxiv.2406.15265,
title = {Perception of Phonological Assimilation by Neural Speech Recognition Models},
author = {Charlotte Pouw and Marianne de Heer Kloots and Afra Alishahi and Willem Zuidema},
journal= {arXiv preprint arXiv:2406.15265},
year = {2024}
}
备注
Accepted for publication in Computational Linguistics (Special Issue on Language Learning, Representation, and Processing in Humans and Machines)