中文

基于噪声语音训练的人工神经网络 exhibits 麦克锡效应

声音 2025-10-30 v2 多媒体 神经与进化计算 音频与语音处理

摘要

人类能够融合听觉和视觉两模态信息以帮助理解语音。这一现象通过一种称为麦克锡效应的现象得以体现:听者听到与听觉和视觉信息不一致的语音时,这些信息会融合成一种错觉的中间音素感知。基于最近提出的用于评估发展性“为什么”问题的人工神经网络框架,我们评估了一组最近的人工神经网络,这些网络是在一致的听觉-视觉语音上训练的,通过测试这些网络对设计用于引发麦克锡效应的听觉-视觉不一致单词进行测试来实现。我们表明,尽管在一致的听觉-视觉语音上完全训练的网络仍会表现出麦克锡感知。我们进一步通过比较在干净语音上训练的网络与在噪声语音上训练的网络,发现噪声语音训练导致所有模型的视觉响应和麦克锡响应显著增加。此外,我们观察到,系统性地增加训练期间听觉噪声水平会增加听觉-视觉整合程度,但在极端噪声水平时,这一整合发展会失败。这些结果表明,过度的噪声暴露可能在听觉-视觉学习的关键时期对听觉-视觉语音整合的发展产生负面影响。本工作还表明,麦克锡效应可从监督和非监督网络的行为中可靠地产生,即使这些网络仅在一致语音上训练。这支持人工神经网络可能是感知和认知某些方面的有用模型的观念。

关键词

引用

@article{arxiv.2411.05715,
  title  = {Artificial Neural Networks Trained on Noisy Speech Exhibit the McGurk Effect},
  author = {Lukas Grasse and Matthew S. Tata},
  journal= {arXiv preprint arXiv:2411.05715},
  year   = {2025}
}