中文

评估用于识别语言模型中社会与数学任务因果单元的对比定位器

计算与语言 2025-08-26 v3 人工智能

摘要

本研究将一种神经科学的对比定位器方法应用于大语言模型(LLM)和视觉-语言模型(VLM)中,以精确定位与心智理论(ToM)和数学推理任务因果相关的单元。在参数规模从 3B 到 90B 的 11 个 LLM 和 5 个 VLM 上,我们使用对比刺激集定位了激活程度最高的单元,并通过定向消融评估其因果作用。我们比较了在既定的 ToM 和数学基准测试中,损伤功能选择的单元与低激活单元及随机选择单元对下游准确率的影响。与预期相反,低激活单元有时比高激活单元产生更大的性能下降,并且从数学定位器导出的单元对 ToM 性能的损害通常大于从 ToM 定位器导出的单元。这些发现对基于对比的定位器的因果相关性提出了质疑,并强调了需要更广泛的刺激集以更准确地捕获任务特定单元。

关键词

引用

@article{arxiv.2508.08276,
  title  = {Evaluating Contrast Localizer for Identifying Causal Units in Social & Mathematical Tasks in Language Models},
  author = {Yassine Jamaa and Badr AlKhamissi and Satrajit Ghosh and Martin Schrimpf},
  journal= {arXiv preprint arXiv:2508.08276},
  year   = {2025}
}

备注

Accepted at the Interplay of Model Behavior and Model Internals Workshop co-located with COLM 2025