中文

MEBM-Speech:面向非侵入式MEG语音检测的多尺度增强脑磁图解码器

声音 2026-03-04 v1 人工智能 音频与语音处理

摘要

我们提出MEBM-Speech,一个用于从非侵入式磁场脑电图(MEG)信号进行语音活动检测的多尺度增强神经解码器。基于BrainMagic骨架,MEBM-Speech集成了三个互补时序建模机制:用于短期模式提取的多尺度卷积模块、用于长程语境建模的双向LSTM(BiLSTM),以及用于高效跨尺度特征融合的深度可分离卷积层。轻量级时序抖动策略与平均池化进一步提升起始点鲁棒性与边界稳定性。该模型实现对MEG信号的连续概率解码,实现对语音与静默状态的精细检测——这一能力对认知神经科学与临床应用至关重要。在LibriBrain Competition 2025 Track1基准上的全面评估显示,模型在验证集上实现了89.3%的平均F1分数,并在官方测试榜单上取得相当的成绩。这些发现凸显了多尺度时序表征学习在稳健MEG语音解码中的有效性。

关键词

引用

@article{arxiv.2603.02255,
  title  = {MEBM-Speech: Multi-scale Enhanced BrainMagic for Robust MEG Speech Detection},
  author = {Li Songyi and Zheng Linze and Liang Jinghua and Zhang Zifeng},
  journal= {arXiv preprint arXiv:2603.02255},
  year   = {2026}
}

备注

5 pages, 1 figure. To appear in the PNPL Competition Workshop at NeurIPS 2025