语言模型中社会政治框架的机械可解释性
计算与语言
2025-10-07 v1 人工智能
计算机与社会
摘要
本文探讨了大型语言模型在生成和识别深层认知框架方面的能力,特别是在社会政治语境中。我们表明,LLM在生成引发特定框架的文本方面具有高度流畅性,能够在零样本设置中识别这些框架。鼓励机械可解释性研究,我们研究了`严格父亲'和`温柔母亲'框架在模型隐藏表示中的位置,识别出与其存在性强相关的单一维度。我们的发现有助于理解LLM如何捕获和表达有意义的人类概念。
引用
@article{arxiv.2510.03799,
title = {Mechanistic Interpretability of Socio-Political Frames in Language Models},
author = {Hadi Asghari and Sami Nenno},
journal= {arXiv preprint arXiv:2510.03799},
year = {2025}
}
备注
Peer-reviewed and presented at Advances in Interpretable Machine Learning and Artificial Intelligence (AIMLAI) Workshop at ECML/PKDD 2024