GPT-2 否定解释:层级与头级因果分析
计算与语言
2026-03-16 v1
摘要
否定仍是现代语言模型面临的持久挑战,常导致语义反转或事实错误。在本工作中,我们对 GPT-2 Small 在内部如何处理此类语言转换进行因果分析。我们同时考察其在层级和头级的隐藏表示。我们的分析基于自建的 12,000 对匹配肯定句和否定句的数据集,涵盖多种语言模板和否定形式。为量化此行为,我们定义指标——否定效应分数(NES),衡量模型区分肯定陈述与其否定形式的敏感度。我们执行两项关键干预以探测因果结构:在激活补丁中,将肯定句的内部激活插入其否定句中以观察语义变化;在消失实验中,暂时禁用特定注意力头以观察逻辑极性变化。总体而言,这些步骤揭示了否定信号如何通过 GPT-2 的各层传播与演变。我们的发现表明,这一能力并非普遍存在;相反,它高度集中于有限数量的中层注意力头中,主要位于第 4 至 6 层。消失这些特定组件会直接破坏模型的否定灵敏度:在本域内消失会导致 NES 增加(表明否定灵敏度减弱),而恢复缓存的肯定激活会进一步增加 NES,确认这些头携带肯定信号而非恢复基线行为。在 xNot360 数据集上,消失略微降低 NES,恢复则将其恢复到基线以上。这一模式表明,这些因果模式在各种否定形式下保持一致,并在外部 xNot360 基准测试中可被检测,尽管幅度较小。
引用
@article{arxiv.2603.12423,
title = {Interpreting Negation in GPT-2: Layer- and Head-Level Causal Analysis},
author = {Abdullah Al Mofael and Lisa M. Kuhn and Ghassan Alkadi and Kuo-Pao Yang},
journal= {arXiv preprint arXiv:2603.12423},
year = {2026}
}
备注
9 pages, 4 figures, 1 table. Accepted at the 2026 IEEE 16th Annual Computing and Communication Workshop and Conference (CCWC)