利用基于 LSTM 的模型从 EEG 中提取不同层次的语音信息
音频与语音处理
2021-06-18 v1 声音
摘要
通过脑电图(EEG)解码人正在聆听的语音信号,有助于我们理解听觉系统的工作方式。线性模型已被用于从语音重建 EEG 或反之。近来,诸如卷积神经网络(CNN)和基于长短期记忆(LSTM)架构的人工神经网络(ANNs)在建模 EEG 与语音之间的关系上超越了线性模型。在尝试将这些模型用于诸如听力测试或(第二)语言理解评估等实际应用之前,我们需要知晓这些模型利用了何种层次的语音信息。在本研究中,我们旨在使用不同层次的语音特征分析基于 LSTM 的模型性能。该模型的任务是判定两个给定语音片段中哪一个与记录的 EEG 相匹配。我们使用了低层与高层语音特征,包括:包络、梅尔频谱图、语音活动、音素身份和词嵌入。我们的结果表明,该模型从 EEG 中利用了关于静音、强度和宽泛语音类别的信息。此外,包含所有这些信息的梅尔频谱图在所有特征中取得了最高准确率(84%)。
引用
@article{arxiv.2106.09622,
title = {Extracting Different Levels of Speech Information from EEG Using an LSTM-Based Model},
author = {Mohammad Jalilpour Monesi and Bernd Accou and Tom Francart and Hugo Van Hamme},
journal= {arXiv preprint arXiv:2106.09622},
year = {2021}
}