解码不同语音模态下的电话对
计算与语言
2026-02-11 v1 机器学习
神经与进化计算
声音
音频与语音处理
摘要
理解语音产生的神经机制对于推进认知神经科学理论以及发展实用性通信技术至关重要。本研究调查了静息状态下运动声学信号以解码语音产生和感知(被动聆听和语音播放)任务中的电话。采用包含 17 名受试者的数据集,我们进行了电话两两分类,将分析范围扩展至 15 种语音电话对。比较了多种机器学习方法,包括正则化线性模型和神经网络架构,以确定其在解码语音信息方面的有效性。我们的结果显示,在语音产生期间的解码准确率(76.6%)显著高于被动聆听和播放模态(约51%),突显了主动语音中所蕴含的更丰富神经信息。among 模型中,弹性网格分类器始终优于更复杂的神经网络,凸显了在数据有限且维度较高的 MEG 数据集中应用正则化技术的有效性。此外,分析特定脑频段后发现,低频振荡,特别是 Delta(0.2-3 Hz)和 Theta(4-7 Hz),对解码准确率贡献最大,表明这些频段编码了与语音产生相关的关键神经过程。尽管采用了先进的降噪方法,但仍不清楚解码是否仅反映神经活动,还是残余肌肉或运动伪影也可能贡献了解码结果,这表明需要进一步的 метод学完善。总体而言,我们的发现凸显了检查主动语音产生范式的重要性,尽管其复杂性仍具备提升脑机接口以帮助严重语言障碍患者的潜在机遇。
引用
@article{arxiv.2505.15355,
title = {Decoding Phone Pairs from MEG Signals Across Speech Modalities},
author = {Xabier de Zuazo and Eva Navas and Ibon Saratxaga and Mathieu Bourguignon and Nicola Molinaro},
journal= {arXiv preprint arXiv:2505.15355},
year = {2026}
}
备注
21 pages, 4 figures, 1 graphical abstract, submitted to Computer Speech and Language (special issue on Iberian Languages)