中文

基于 SAE 的机制可解释性:探索 LLM 中的宗教、暴力与地理概念

机器学习 2025-09-23 v1 人工智能 计算机与社会

摘要

尽管对大型语言模型(LLM)中的偏见有着日益增长的研究,但大多数工作仅聚焦于性别和种族,对于宗教身份关注不足。本文探讨了宗教在 LLM 中的内部表征方式及其与暴力与地理概念的交叉关系。通过机制可解释性方法和稀疏自编码器(SAE)运用 Neuronpedia API,我们分析了五个模型中的潜在特征激活情况。我们衡量了与宗教相关提示与暴力相关提示之间的重叠度,并探测语义模式在激活上下文中的表现。虽然五种宗教在内部凝聚性表现相似,但伊斯兰教更频繁地与暴力语言相关特征相联系。相比之下,地理关联主要反映现实世界的宗教人口分布,揭示了模型如何嵌入事实分布以及文化刻板印象。这些发现凸显了结构性分析在审计模型内部表征方面的价值,这些表征塑造了模型的行为。

关键词

引用

@article{arxiv.2509.17665,
  title  = {Mechanistic Interpretability with SAEs: Probing Religion, Violence, and Geography in Large Language Models},
  author = {Katharina Simbeck and Mariam Mahran},
  journal= {arXiv preprint arXiv:2509.17665},
  year   = {2025}
}

备注

Accepted at AEQUITAS 2025: Workshop on Fairness and Bias in AI | co-located with ECAI, October 26th, 2025, Bologna, Italy. 12 pages, 1 figure