中文

基于非线性分类范式从 EEG 预测语音可懂度

音频与语音处理 2021-11-30 v4 机器学习 声音 信号处理 定量方法

摘要

目的:目前仅有行为语音理解测试可用,其需要被测者的主动配合。由于这在某些人群中不可行,因此需要一种客观语音可懂度测量方法。近来,脑成像数据已被用于建立刺激与脑响应之间的关系。线性模型已成功关联语音可懂度,但需逐被试训练。我们提出一种基于深度学习、结合膨胀卷积的模型,工作于匹配/失配范式下。该模型匹配/失配预测的准确性可用作语音可懂度的替代指标,无需被试特异性(重新)训练。方法:我们评估了模型性能随输入片段长度、EEG 频带和感受野大小的变化,并与多个基线模型比较。接着,我们在留出数据上评估性能并进行微调。最后,我们建立了模型准确性与最先进的行为 MATRIX 测试之间的联系。主要结果:除 delta 和 theta 频带外,对于各输入片段长度、所有 EEG 频带以及 250 至 500 ms 的感受野大小,膨胀卷积模型均显著优于基线模型。此外,微调显著提高了在留出数据集上的准确性。最后,使用行为 MATRIX 测试估计的语音接收阈与我们客观方法之间发现显著相关(r=0.59,p=0.0154)。意义:我们的方法首次从 EEG 为未见过的被试预测语音接收阈,有助于客观测量语音可懂度。

关键词

引用

@article{arxiv.2105.06844,
  title  = {Predicting speech intelligibility from EEG in a non-linear classification paradigm},
  author = {Bernd Accou and Mohammad Jalilpour Monesi and Hugo Van hamme and Tom Francart},
  journal= {arXiv preprint arXiv:2105.06844},
  year   = {2021}
}

备注

12 pages, 12 figures