利用扩张卷积网络关联语音基频与脑电
音频与语音处理
2022-07-25 v1
摘要
为研究语音在大脑中的处理机制,我们可以对自然语音信号的特征与相应记录的脑电图(EEG)之间的关系建模。通常,线性回归任务中使用线性模型:要么预测EEG,要么重建语音,并以预测信号与实际信号间的相关性来衡量大脑的解码能力。然而,鉴于大脑的非线性本质,线性模型的建模能力有限。近期研究引入了非线性模型来关联语音包络与EEG。我们着手纳入包络中未编码的其他语音特征,尤其是嗓音基频(f0)。f0是一种主要在脑干至中脑水平编码的高频特征。我们提出一种扩张卷积模型,为f0的神经追踪提供证据。我们表明,f0与语音包络的组合可改进最先进的基于包络的模型性能。这表明扩张卷积模型能从f0和包络中提取非冗余信息。我们还展示了该扩张卷积模型对训练时未包含被试的泛化能力。后一发现将加速基于f0的听力诊断。
引用
@article{arxiv.2207.01963,
title = {Relating the fundamental frequency of speech with EEG using a dilated convolutional network},
author = {Corentin Puffay and Jana Van Canneyt and Jonas Vanthornhout and Hugo Van Hamme and Tom Francart},
journal= {arXiv preprint arXiv:2207.01963},
year = {2022}
}
备注
Accepted for Interspeech 2022