中文

自监督音频模型有效解释人类对语音的皮层响应

计算与语言 2022-05-31 v1

摘要

自监督语言模型在预测语言理解过程中的高层皮层响应方面非常有效。然而,当前人脑低层听觉处理的最佳模型依赖于手工构建的声学滤波器或来自有监督音频神经网络的表示。在本工作中,我们利用自监督语音表示学习(SSL)的进展,创建了新的最先进的人体听觉系统模型。与声学基线、音素特征及有监督模型相比,自监督模型(APC、wav2vec、wav2vec 2.0 与 HuBERT)中间层的表示在听觉皮层(AC)内 fMRI 记录的最佳预测性能上持续占优。参与低层听觉处理的脑区表现出对较早 SSL 模型层的偏好,而高层语义区偏好较晚层。我们表明这些趋势源于模型沿其表示深度在多个语言层级(声学、语音与词汇)编码信息的能力。总体而言,这些结果表明自监督模型有效捕捉了与人脑语音处理不同阶段相关的信息层级。

关键词

引用

@article{arxiv.2205.14252,
  title  = {Self-supervised models of audio effectively explain human cortical responses to speech},
  author = {Aditya R. Vaidya and Shailee Jain and Alexander G. Huth},
  journal= {arXiv preprint arXiv:2205.14252},
  year   = {2022}
}

备注

Accepted to the International Conference on Machine Learning (ICML) 2022