GPT-2 的机制可解释性:情感分析中的词法层与语境层
计算与语言
2025-12-09 v1 人工智能
摘要
我们提出了一项针对 GPT-2 的机制可解释性研究,通过因果分析考察其 Transformer 层如何处理情感信息。利用跨所有 12 层的系统性激活修补,我们检验了假设的两阶段情感架构——早期词法检测与中层语境整合。实验证实早期层(0–3)充当词法情感检测器,编码稳定的、位置特定的极性信号,且基本独立于语境。然而,三个语境整合假设——中层集中、现象特异性与分布式处理——均被否定。我们发现,语境现象(如否定、讽刺、领域偏移等)并非在中层特化,而是主要通过统一的非模块化机制在后期层(8–11)中整合。这些实验结果为 GPT-2 的情感计算不同于预测的层次模式提供了因果证据,凸显了对大语言模型中语境整合进行进一步实证表征的必要性。
引用
@article{arxiv.2512.06681,
title = {Mechanistic Interpretability of GPT-2: Lexical and Contextual Layers in Sentiment Analysis},
author = {Amartya Hatua},
journal= {arXiv preprint arXiv:2512.06681},
year = {2025}
}