让 Wav2Vec2 了解大脑的语言
机器学习
2025-01-17 v1
摘要
从神经活动解码连续 spoken speech 的能力,有潜力成为瘫痪患者的重要临床解决方案。深度学习脑机接口 (BCI) 近期已成功将神经活动映射到尝试构思语音的主体的文本内容。然而,仅有少量 BCI 数据集可用。相比之下,针对从音频中进行语音识别的标签数据和预训练模型广泛可用。其中一种模型是 Wav2Vec2,它以自监督方式训练,以创建有意义的语音音频数据的表示。本研究中,我们展示了 Wav2Vec2 所学习的模式可转移到脑数据中。具体而言,我们用一个未预训练的大脑特征提取器 (BFE) 模型取代其音频特征提取器。随后我们使用预训练的 Wav2Vec2 权重进行完整微调,训练“从头开始”且不使用预训练权重的模型,以及冻结预训练的 Wav2Vec2 并仅训练 BFE 每种 45 种不同的 BFE 架构进行训练。在这些实验中,最佳结果来自使用预训练权重进行完整微调, achieving a 字符错误率 (CER) 为 18.54\%,超过最佳从头训练运行结果的 20.46\%,以及冻结 Wav2Vec2 训练结果的 15.92\% 百分点。这些结果表明,从音频语音识别知识转移到脑解码是可能的,并且显著改善了相同架构下的脑解码性能。相关源码可在 https://github.com/tfiedlerdev/Wav2Vec2ForBrain 中获得。
引用
@article{arxiv.2501.09459,
title = {Teaching Wav2Vec2 the Language of the Brain},
author = {Tobias Fiedler and Leon Hermann and Florian Müller and Sarel Cohen and Peter Chin and Tobias Friedrich and Eilon Vaadia},
journal= {arXiv preprint arXiv:2501.09459},
year = {2025}
}
备注
Paper was submitted to ICASSP 2025 but marginally rejected