中文

Brain Score 追踪语言的共享属性:来自多种自然语言与结构化序列的证据

计算与语言 2026-04-20 v1

摘要

近期基于神经网络的语言模型(LM)取得突破,引发了一个问题:这些模型的处理过程与人类语言处理有多大相似度?使用名为 Brain Score (BS) 的框架——通过 LM 激活来预测阅读时的 fMRI 激活——所得到的结果,被用来论证二者具有高度的相似性。为了理解这种相似性,我们通过在不同类型的输入数据上训练 LM 并在 BS 上进行评估来开展实验。我们发现,在来自许多不同语系的多种自然语言上训练的模型具有非常相似的 BS 性能。在其他结构化数据——人类基因组、Python 和纯层级结构(嵌套括号)——上训练的 LM 也表现相当不错,在某些情况下接近自然语言。这些发现表明,BS 能够凸显语言模型跨自然语言提取共同结构的能力,但该指标可能不够敏感,以至于我们无法仅凭高 BS 分数推断出类人的处理过程。

关键词

引用

@article{arxiv.2604.15503,
  title  = {Brain Score Tracks Shared Properties of Languages: Evidence from Many Natural Languages and Structured Sequences},
  author = {Jingnong Qu and Ashvin Ranjan and Shane Steinert-Threlkeld},
  journal= {arXiv preprint arXiv:2604.15503},
  year   = {2026}
}