大语言模型中语义角色回路的涌现与定位
计算与语言
2026-01-07 v2
摘要
尽管大语言模型展现出语义能力,但其内部将抽象语义结构具体化的机制仍未得到充分刻画。我们提出了一种整合角色交叉最小对、时间涌现分析和跨模型比较的方法,以研究大语言模型如何实现语义角色。我们的分析揭示了:(i) 高度集中的回路(89-94% 的归因集中在 28 个节点内);(ii) 逐步的结构细化而非相变,且更大的模型有时会绕过局部化回路;(iii) 中等程度的跨尺度保守性(24-59% 的组件重叠)以及高度的谱相似性。这些发现表明,大语言模型为抽象语义结构形成了紧凑、因果隔离的机制,并且这些机制在不同尺度和架构间表现出部分迁移性。
引用
@article{arxiv.2511.20910,
title = {Emergence and Localisation of Semantic Role Circuits in LLMs},
author = {Nura Aljaafari and Danilo S. Carvalho and André Freitas},
journal= {arXiv preprint arXiv:2511.20910},
year = {2026}
}