中文

脑卒中前体为语言模型可解释性提供罗塞塔石碑

机器学习 2026-02-05 v1 计算与语言

摘要

大型语言模型(LLM)已取得显著进展,但验证哪些模型组件真正关键于语言功能的方法仍有限。当前的可解释性方法依赖于内部指标,缺乏外部验证。本文提出了大脑-LLM 统一模型(BLUM),该框架利用前体-症状映射这一方法作为外部参考结构来评估 LLM 扰动效应。该方法已连续十余年是建立因果脑-行为关系的金标准。我们采用来自慢性后卒中性精瘫患者(N = 410)的数据,训练症状-前体模型,从行为错误轮廓预测脑损伤位置,随后对 transformer 各层进行系统性扰动,对扰动后的 LLM 和人类患者实施相同的临床评估,并将 LLM 错误轮廓投射到人类前体空间中。实验结果表明,LLM 错误轮廓与人类错误轮廓足够相似,以致预测的前体位置在 67% 的图片命名情境(p < 10^{-23})和 68.3% 的句子完成情境(p < 10^{-61})中对应于实际前体损伤。语义主导错误映射到侧颈束前体模式,音素主导错误映射到背脑束模式。这些发现为 LLM 可解释性开辟了新的方法论方向,建立了临床神经科学作为人工语言系统外部验证的参考框架,激发了对行为对齐是否反映共享计算原理的直接调查的动力。

关键词

引用

@article{arxiv.2602.04074,
  title  = {Stroke Lesions as a Rosetta Stone for Language Model Interpretability},
  author = {Julius Fridriksson and Roger D. Newman-Norlund and Saeed Ahmadi and Regan Willis and Nadra Salman and Kalil Warren and Xiang Guan and Yong Yang and Srihari Nelakuditi and Rutvik Desai and Leonardo Bonilha and Jeff Charney and Chris Rorden},
  journal= {arXiv preprint arXiv:2602.04074},
  year   = {2026}
}

备注

45 pages, 17 figures