LibriBrain:超过50小时的被试内MEG数据以大规模改进语音解码方法
机器学习
2025-06-04 v1
摘要
LibriBrain代表了迄今为止用于语音解码的最大单被试MEG数据集,拥有超过50小时的录音——比次大的可比数据集大5倍,比大多数数据集大50倍。这种前所未有的被试内数据“深度”使得能够以前所未有的规模使用非侵入性方法探索神经表征。LibriBrain包含高质量的MEG记录和来自一名聆听自然英语口语的参与者的详细注释,涵盖了几乎全部的Sherlock Holmes正典。旨在支持神经解码的进步,LibriBrain附带了一个Python库以简化与深度学习框架的集成,用于可复现性的标准数据划分,以及三个基础解码任务的基线结果:语音检测、音素分类和单词分类。基线实验表明,增加训练数据可带来解码性能的显著提升,突显了扩展深度被试内数据集的价值。通过发布该数据集,我们旨在赋能研究社区推进语音解码方法,并加速开发安全、有效的临床脑机接口。
引用
@article{arxiv.2506.02098,
title = {LibriBrain: Over 50 Hours of Within-Subject MEG to Improve Speech Decoding Methods at Scale},
author = {Miran Özdogan and Gilad Landau and Gereon Elvers and Dulhan Jayalath and Pratik Somaiya and Francesco Mantegna and Mark Woolrich and Oiwi Parker Jones},
journal= {arXiv preprint arXiv:2506.02098},
year = {2025}
}
备注
37 pages, 14 figures, 13 tables. Under review