中文

稀疏特征共激活揭示大语言模型中的因果语义模块

计算与语言 2026-04-21 v3 人工智能

摘要

我们使用从仅少数提示中收集的稀疏自编码器(SAE)特征共激活,识别大语言模型(LLM)中语义连贯、上下文一致的网络组件。我们聚焦于概念-关系预测任务,表明消除这些组件(例如国家和单词的概念,首都城市和翻译语言的关系)会以可预测的方式改变模型输出,而放大这些组件则诱导反事实性响应。值得注意的是,组合关系组件和概念组件可产生复合反事实输出。进一步分析显示,尽管大多数概念组件从第一层便出现,但更抽象的关系组件集中在后续层中。最后,我们表明提取的组件比单个特征更全面地捕获概念和关系,同时保持特定性。总体而言,我们的发现表明知识在LLM中的模块化组织,并推进了高效、面向目标的LLM操作方法。

关键词

引用

@article{arxiv.2506.18141,
  title  = {Sparse Feature Coactivation Reveals Causal Semantic Modules in Large Language Models},
  author = {Ruixuan Deng and Xiaoyang Hu and Miles Gilberti and Shane Storks and Aman Taxali and Mike Angstadt and Chandra Sripada and Joyce Chai},
  journal= {arXiv preprint arXiv:2506.18141},
  year   = {2026}
}

备注

ACL 2026