中文

基于Conformer的MEG解码器用于鲁棒的语音和音素分类

计算与语言 2026-02-11 v2 机器学习 神经与进化计算 声音

摘要

从非侵入性MEG中解码与语音相关信息是实现可扩展脑机接口的关键步骤。我们在LibriBrain 2025 PNPL基准测试中提出紧凑型Conformer解码器,用于两个核心任务:语音检测和音素分类。我们的方案将紧凑型Conformer适配原始306通道MEG信号,采用轻量级卷积投影层和任务特定的头部。在语音检测方面,提供了首次探索MEG专用数据增强的MEG导向SpecAugment。在音素分类方面,我们使用倒数平方根类别权重和动态分组数据加载器,以处理100个样本平均后的示例。此外,一个简单的实例级归一化对于缓解持有集上的分布偏移至关重要。使用官方标准轨道分割和F1-macro指标进行模型选择,我们的最佳系统在排行榜上分别实现了88.9%(语音)和65.8%(音素),在音素分类标准轨道中获胜。有关进一步的实现细节,技术文档、源代码和检查点均可在https://github.com/neural2speech/libribrain-experiments获取。

关键词

引用

@article{arxiv.2512.01443,
  title  = {MEGConformer: Conformer-Based MEG Decoder for Robust Speech and Phoneme Classification},
  author = {Xabier de Zuazo and Ibon Saratxaga and Eva Navas},
  journal= {arXiv preprint arXiv:2512.01443},
  year   = {2026}
}

备注

8 pages, 7 figures, 4 tables, v1 presentend in LibriBrain Workshop, NeurIPS 2025; v2 submitted to Odyssey 2026