神经语音模型中的类人语言偏见:Wav2Vec2.0 中的音素分类与音素约束
计算与语言
2024-07-04 v1 人工智能
声音
音频与语音处理
摘要
深层神经语音模型了解多少关于语音学的信息?现有研究考察了对单个语言单元(如音素)的编码。本文探讨了单元之间的相互作用。灵感来自对人类语音感知的经典实验,我们研究了 Wav2Vec2 如何解决音素约束。我们合成了在 /l/ 与 /r/ 之间形成声学连续体的声音,并嵌入受控语境(仅包含 /l/、仅包含 /r/,或两者都不包含)以进行控制。像人类一样,Wav2Vec2 模型在处理此类模糊声音时表现出对音素可接受类别的偏好。通过简单措施分析模型内部在单个刺激水平上的行为,我们发现这一偏好在模型 Transformer 模块的早期层中出现。该效应在 ASR 微调后被放大,但也在完全自监督模型中存在。我们的方法展示了受控刺激设计如何帮助局部化神经语音模型中的特定语言知识。
引用
@article{arxiv.2407.03005,
title = {Human-like Linguistic Biases in Neural Speech Models: Phonetic Categorization and Phonotactic Constraints in Wav2Vec2.0},
author = {Marianne de Heer Kloots and Willem Zuidema},
journal= {arXiv preprint arXiv:2407.03005},
year = {2024}
}
备注
Accepted to Interspeech 2024. For code and materials, see https://github.com/mdhk/phonotactic-sensitivity