大脑的苦涩教训:通过自监督学习扩展语音解码
机器学习
2025-06-03 v5
摘要
过去几年来,语音从脑活动解码取得了显著进展,主要由大型单主体数据集驱动。然而,由于解剖差异、任务设计和扫描硬件的差异,跨主体和数据集的利用仍具挑战。结果是该领域未能从日益增长的开放神经数据存储库中获益于大规模深度学习。为此,我们开发了神经科学导向的自监督目标函数及其对应架构,以从异构脑记录中进行学习。我们的方案扩展至近400小时MEG数据和900名受试者,展示了在受试者、数据集、任务甚至新受试者上的广泛泛化。其在SOTA模型上实现了15%-27%的改进,并以非侵入数据匹配手术解码的性能。这些进展解锁了超越当前前沿的语音解码模型扩展潜力。
引用
@article{arxiv.2406.04328,
title = {The Brain's Bitter Lesson: Scaling Speech Decoding With Self-Supervised Learning},
author = {Dulhan Jayalath and Gilad Landau and Brendan Shillingford and Mark Woolrich and Oiwi Parker Jones},
journal= {arXiv preprint arXiv:2406.04328},
year = {2025}
}
备注
Published as a conference paper at ICML 2025. 16 pages, 4 figures, 4 tables