中文

使用联合 CNN-LSTM 模型从 EEG 中提取双说话人场景下的听觉注意

声音 2021-07-12 v2 人工智能 机器学习 音频与语音处理

摘要

人脑在多说话人场景中分离特定说话人与干扰说话人的表现极为出色。最近研究表明,我们可以通过建模听觉场景中存在的语音信号与使用脑电图(EEG)测量的听者皮层信号之间的关系,来定量评估这种分离能力。这为将神经反馈集成到助听器中开辟了途径,使设备能够推断用户注意并增强被注意的说话人。常用的推断听觉注意的算法基于线性系统理论,其中将语音包络等线索映射到 EEG 信号。在此,我们提出一种联合卷积神经网络(CNN)-长短期记忆(LSTM)模型来推断听觉注意。我们的联合 CNN-LSTM 模型以 EEG 信号和多说话人的谱图作为输入,并将注意分类为其中一位说话人。我们使用包含 61 名受试者的三个不同数据集评估了神经网络的可靠性,每名受试者进行了双说话人实验。所分析的三个数据集对应于以三种不同语言(即德语、丹麦语和荷兰语)呈现的语音刺激。使用所提出的联合 CNN-LSTM 模型,我们在三秒的试验时长下获得了 77.2% 的中位解码准确率。此外,我们通过幅度剪枝评估了模型可容忍的稀疏程度,发现模型可容忍高达 50% 的稀疏度而不会造成解码准确率的实质性损失。

关键词

引用

@article{arxiv.2102.03957,
  title  = {Extracting the Auditory Attention in a Dual-Speaker Scenario from EEG using a Joint CNN-LSTM Model},
  author = {Ivine Kuruvila and Jan Muncke and Eghart Fischer and Ulrich Hoppe},
  journal= {arXiv preprint arXiv:2102.03957},
  year   = {2021}
}

备注

18 pages, 6 figures