中文

用于想象语音识别的EEG频带分析

信号处理 2022-03-30 v1 计算与语言 声音 音频与语音处理 神经元与认知

摘要

自动语音识别(ASR)接口在日常生活里用于电子设备的交互与控制已日益普及。当前使用的接口对诸如患有言语障碍、闭锁综合征、瘫痪或具有极高隐私需求的人群而言并不可行。在此类情况下,能够利用脑电图(EEG)信号识别想象语音的接口将大有裨益。过去已有多种针对该问题的工作。然而,在识别有助于想象语音识别的EEG信号频带(δ,θ,α,β,γ\delta, \theta, \alpha, \beta, \gamma)方面,相关工作有限。因此,本工作中我们旨在分析不同EEG频带以及从大脑不同脑叶获取的信号的意义及其对识别想象语音的贡献。从不同的脑叶获取并针对不同的频带进行带通滤波的信号,被输入至由卷积神经网络(CNN)与长短期记忆(LSTM)构成的时空深度学习架构。性能在一个公开可用数据集上评估,该数据集包含三个分类任务——数字、字符与图像。我们在三个任务上分别取得了85.93%85.93\%87.27%87.27\%87.51%87.51\%的分类准确率。实现代码已发布于 https://github.com/ayushayt/ImaginedSpeechRecognition。

关键词

引用

@article{arxiv.2203.15250,
  title  = {Analysis of EEG frequency bands for Envisioned Speech Recognition},
  author = {Ayush Tripathi},
  journal= {arXiv preprint arXiv:2203.15250},
  year   = {2022}
}