中文

从分钟到数日:通过有监督预训练扩展颅内语音解码

声音 2025-12-19 v1 计算与语言 神经元与认知

摘要

从大脑活动中解码语音通常依赖于在短暂且高度受控的实验期间收集的有限神经记录。在此,我们引入一个框架,利用接受临床监测的患者长达数周的颅内和音频记录,有效地将训练数据集规模增大了两个数量级以上。通过这种预训练,我们的对比学习模型显著优于仅在经典实验数据上训练的模型,其增益随数据集规模呈对数线性增长。对所学表征的分析表明,虽然大脑活动表征了语音特征,但其全局结构在数天内会发生大幅漂移,这凸显了对能够显式处理跨日变异性的模型的需求。总体而言,我们的方法为在现实生活和受控任务环境中解码和建模大脑表征开辟了一条可扩展的路径。

关键词

引用

@article{arxiv.2512.15830,
  title  = {From Minutes to Days: Scaling Intracranial Speech Decoding with Supervised Pretraining},
  author = {Linnea Evanson and Mingfang Zhang and Hubert Banville and Saarang Panchavati and Pierre Bourdillon and Jean-Rémi King},
  journal= {arXiv preprint arXiv:2512.15830},
  year   = {2025}
}

备注

Linnea Evanson* and Mingfang (Lucy) Zhang* are joint first authors. Pierre Bourdillon** and Jean-R\'emi King** are joint last authors