分布偏移下从 MEG 信号测量语音识别的鲁棒性
声音
2026-04-07 v1 机器学习
摘要
本研究利用 2025 年 PNPL 竞赛的 LibriBrain 音素分类基准,调查了从非侵入式 MEG 信号中进行鲁棒的语音相关解码。我们比较了残差卷积神经网络(CNN)、基于 STFT 的 CNN 以及 CNN-Transformer 混合模型,同时考察了组平均、标签平衡、重复分组、归一化策略和数据增强的影响。在我们的内部实现中,预处理和数据配置选择比额外的架构复杂性更为重要,其中实例归一化是泛化中最具影响力的修改。我们最强的模型——带有组平均、标签平衡、重复分组和实例归一化的 CNN——在测试集上实现了 60.95% 的 F1-macro,而 plain CNN 基线为 39.53%。然而,我们的大多数模型在没有实例归一化的情况下,在验证集到测试集之间表现出显著的退化,这表明由不同归一化统计量引起的分布偏移是我们实验中泛化的主要障碍。相比之下,MEGConformer 在验证集和测试集上均保持了 64.09% 的 F1-macro,显著性图分析在定性上与此对比一致:较弱的模型在不同分割中表现出更集中或重复的音素敏感模式,而 MEGConformer 看起来更分散。总体而言,结果表明提高非侵入式音素解码的可靠性可能需要更好地处理与归一化相关的分布偏移,同时也要应对单次试验解码的挑战。
引用
@article{arxiv.2604.04129,
title = {Measuring Robustness of Speech Recognition from MEG Signals Under Distribution Shift},
author = {Sheng-You Chien and Bo-Yi Mao and Yi-Ning Chang and Po-Chih Kuo},
journal= {arXiv preprint arXiv:2604.04129},
year = {2026}
}
备注
17 pages, 6 figures, LibriBrain Competition @NeurIPS2025