中文

归纳偏置、预训练与微调共同解释大脑对语音的反应

计算与语言 2021-03-02 v1 声音 音频与语音处理 神经元与认知

摘要

迄今为止,我们理解语音的能力仍未被深度学习模型超越。这一成就可能源于大脑将其通用声音表征微调至语音特异性处理的能力。为验证该假设,我们将 i) 五类深度神经网络与 ii) 由口语句子诱发并在 102 名荷兰受试者中使用功能性磁共振成像(fMRI)记录的人脑反应进行比较。每个网络要么在声学场景分类、语音转文本任务(基于孟加拉语、英语或荷兰语)上训练,要么未经训练。通过在对最优线性投影后的各自激活进行相关,评估每个模型与大脑之间的相似性。跨网络的大脑相似性差异揭示了三个主要结果。首先,大脑中的语音表征可由随机深度网络解释。其次,学习分类声学场景使深度网络增加了其大脑相似性。第三,学习处理语音相关输入(即荷兰语对英语)使深度网络达到比学习处理语音疏远输入(即荷兰语对孟加拉语)更高水平的大脑相似性。总之,这些结果表明人脑将其高度训练的听觉层级微调以学会处理语音。

关键词

引用

@article{arxiv.2103.01032,
  title  = {Inductive biases, pretraining and fine-tuning jointly account for brain responses to speech},
  author = {Juliette Millet and Jean-Remi King},
  journal= {arXiv preprint arXiv:2103.01032},
  year   = {2021}
}

备注

10 pages, 3 figures