中文

Brain Treebank:基于自然语言刺激的大规模颅内记录数据集

神经元与认知 2024-11-14 v1

摘要

我们发布了 Brain Treebank,这是一个大规模电生理神经响应数据集,通过颅内探针记录自 10 名受试者在观看一至多部好莱坞电影时的脑活动。受试者平均观看 2.6 部电影,平均观看时长 4.3 小时,总计 43 小时。每部电影的音频轨经人工校正后转写为文本。每部电影的音频频谱图上的人工标注给出了词起始时间。每份转写文本经自动解析并人工校正为通用依存(UD)形式,为每个词分配词性,为每个句子分配依存句法分析。受试者总共听到超过 38,000 个句子(223,000 个词),平均植入 168 个电极。这是包含有实证自然语言的最大规模颅内记录数据集,也是最大的英文 UD 语料库之一,同时也是极少数与多模态特征对齐的 UD 语料库之一。我们期望该数据集能成为语言学概念、感知及其神经表征之间的桥梁。为此,我们分析了哪些电极对语言特征敏感,并勾勒出这些电极上语言处理的大致时间进程。Brain Treebank 可在 https://BrainTreebank.dev/ 获取。

关键词

引用

@article{arxiv.2411.08343,
  title  = {Brain Treebank: Large-scale intracranial recordings from naturalistic language stimuli},
  author = {Christopher Wang and Adam Uri Yaari and Aaditya K Singh and Vighnesh Subramaniam and Dana Rosenfarb and Jan DeWitt and Pranav Misra and Joseph R. Madsen and Scellig Stone and Gabriel Kreiman and Boris Katz and Ignacio Cases and Andrei Barbu},
  journal= {arXiv preprint arXiv:2411.08343},
  year   = {2024}
}

备注

36 pages, 17 figures; Accepted at NeurIPS Dataset and Benchmarks 2024