2025 年 PNPL 竞赛:LibriBrain 数据集中的语音检测与音素分类
机器学习
2025-06-13 v1 声音
音频与语音处理
摘要
从非侵入性脑数据中解码语音的进展具有巨大的社会影响潜力。最具前景的应用之一是为因言语缺陷(如困性说话)而受影响的瘫痪患者恢复沟通能力,而无需进行高风险的手术干预。2025 年 PNPL 竞赛的终极目标是通过发挥机器学习社区的集体力量,为非侵入性神经解码创造“ImageNet 时刻”或突破性进展的条件。为实现这一愿景,我们提出了迄今为止录制的最大规模 within-subject MEG 数据集(LibriBrain),并提供一个用户友好的 Python 库(pnpl),便于轻松访问数据并与深度学习框架集成。对于本竞赛,我们定义了两项基础性任务(即从脑数据进行语音检测与音素分类),配套标准化的数据划分与评估指标、示例基准模型、在线教程代码、社区讨论板以及公开排行榜以便提交。为促进可访问性与参与,本竞赛特色为强调算法创新的 Standard track,以及预期奖励更大规模计算的 Extended track,加速向非侵入性脑机接口语音系统迈进。
引用
@article{arxiv.2506.10165,
title = {The 2025 PNPL Competition: Speech Detection and Phoneme Classification in the LibriBrain Dataset},
author = {Gilad Landau and Miran Özdogan and Gereon Elvers and Francesco Mantegna and Pratik Somaiya and Dulhan Jayalath and Luisa Kurth and Teyun Kwon and Brendan Shillingford and Greg Farquhar and Minqi Jiang and Karim Jerbi and Hamza Abdelhedi and Yorguin Mantilla Ramos and Caglar Gulcehre and Mark Woolrich and Natalie Voets and Oiwi Parker Jones},
journal= {arXiv preprint arXiv:2506.10165},
year = {2025}
}