中文

语言模型是否编码语义关系?基于探针与稀疏特征分析

计算与语言 2026-04-01 v2

摘要

了解大型语言模型(LLM)是否捕获结构化意义,要求考察其如何表示概念关系。在本工作中,我们研究了三个规模递增的模型:Pythia-70M、GPT-2和Llama 3.1 8B,关注四种语义关系:同义关系、反义关系、层次上位关系和层次从属关系。我们结合线性探针与机制可解释性技术,包括稀疏自编码器(SAE)和激活修补,来识别这些关系被编码的位置以及特定特征如何贡献于其表示。我们的结果揭示了层次关系中的方向性不对称性:层次上位关系被冗余编码且抗抑制,而层次从属关系依赖紧凑特征,更容易因消失而被破坏。更广泛地说,关系信号是分散的,但呈现稳定的配置文件:它们在中层达到峰值,在残差后/MLP路径上强于注意力中。难度在模型之间保持一致(反义关系最易,同义关系最难)。探针层面的因果性随容量而变:在Llama 3.1上,SAE引导的修补可靠地移动这些信号,而在较小模型上,位移弱且不稳定。我们的结果阐明了语义关系在LLM内部被表示的何处以及其可靠性,并提供了将稀疏特征与探针层面因果证据关联的可复现框架。

关键词

引用

@article{arxiv.2603.17624,
  title  = {Do Language Models Encode Semantic Relations? Probing and Sparse Feature Analysis},
  author = {Andor Diera and Ansgar Scherp},
  journal= {arXiv preprint arXiv:2603.17624},
  year   = {2026}
}

备注

accepted at LREC 2026