从 EEG 信号到全端到端听觉语音解码
信号处理
2024-06-14 v1 人工智能
声音
音频与语音处理
摘要
从脑电图(EEG)信号解码语音是一项具有挑战性的任务,其中对大脑活动进行建模以估计听觉刺激的显著特征。我们提出了 FESDE,一种用于从 EEG 信号进行全端到端语音解码的新框架。我们的方法旨在根据给定的 EEG 信号直接重建听到的语音波形,无需中间声学特征处理步骤。所提出的方法由一个 EEG 模块、一个语音模块以及一个连接器组成。EEG 模块学习更好地表示 EEG 信号,而语音模块从模型表示生成语音波形。连接器学习桥接 EEG 和语音潜在空间的分布。所提出的框架通过允许单步推理,既简单又高效,并且在客观指标上优于先前的工作。我们进行了细粒度的音素分析,以揭示语音解码的模型特性。源代码可在此处获取:github.com/lee-jhwn/fesde。
引用
@article{arxiv.2406.08644,
title = {Toward Fully-End-to-End Listened Speech Decoding from EEG Signals},
author = {Jihwan Lee and Aditya Kommineni and Tiantian Feng and Kleanthis Avramidis and Xuan Shi and Sudarsana Kadiri and Shrikanth Narayanan},
journal= {arXiv preprint arXiv:2406.08644},
year = {2024}
}
备注
accepted to Interspeech2024