中文

阅读任务在激活值上的失效:GPT-2 Small 在间接宾语识别上的稀疏特征审计

机器学习 2026-05-22 v1

摘要

我们报告了对 GPT-2 small 在间接宾语识别(IOI)任务中失败与成功 trial 中稀疏自动编码器(SAE)特征发放情况的小规模可重复审计。在 300 个提示中,GPT-2 small 达到 79.7% 的准确率;在 layer-8 残差流 SAE 版本中,24,576 个特征中有 146 个通过 Holm 校正显著性阈值,105 个达到较大效应大小(|Cohen's d| > 0.8)。最强的单一失败相关特征——特征 17,491,d=+2.93,Neuronpedia 标签为“密码学密钥”——除非提示中转移的宾语是“密钥”,否则几乎安静。在该情境下,GPT-2 small 在“密钥”提示下失败率高达 93.3%,而在其他七个宾语上仅为 7.5%(Fisher exact p = 8.79 x 10^-33)。我们对该相关特征进行了三项控制测试,机械主张的 claim 应通过这些测试。(i)因果消除:在所有 45 个“密钥”提示的残差流中消除特征 17,491,未能恢复准确率(6.7% -> 4.4%);该特征是相关因素,而非该层的充分原因。(ii)表示基线:对原始 768 维残差流进行逻辑回归达到 5 折 ROC AUC = 0.929,匹配前 100 个 SAE 特征(0.927);SAE 基底增加可解释性,而非预测性能。(iii)随机种子稳健性检查:在五个随机种子下,密钥子集失败率保持在 75.0--93.3% 之间(行为效应为实),但特征 17,491 在仅 1 个随机运行中位列前 |d| 特征。因此,方法学贡献是审计管线(低成本、模型无关、表面命名相关因素),而非通过其发现的任何单个特征。我们发布了代码、300 提示语料库、300x24,576 激活矩阵、消除与基线脚本以及图表。该完整管线可在笔记本电脑上运行(Apple M3 Max,无离散 GPU)。

关键词

引用

@article{arxiv.2605.22719,
  title  = {Reading Task Failure Off the Activations: A Sparse-Feature Audit of GPT-2 Small on Indirect Object Identification},
  author = {Mahdi Nasermoghadasi},
  journal= {arXiv preprint arXiv:2605.22719},
  year   = {2026}
}

备注

10 pages, 7 figures