大型语言模型中注意力模式的规模化自动发现
机器学习
2026-04-07 v1 人工智能
摘要
大型语言模型通过规模化提升能力在通用设置中取得成功。然而,解释性方法 unfortunately 不能说同样的话。当前的 mechanistic 解释趋势是提供受控环境中特定行为的精确解释。这些方法往往不具可迁移性,或对更大规模的研究资源密集。在本工作中,我们提出通过挖掘 Java 代码数据集中的完成场景来研究大型语言模型中的重复行为,利用代码的结构性特征。我们收集注意力头中生成的注意力模式,表明它们是全局解释模型组件的可扩展信号。我们展示视觉模型为分析注意力模式提供了有前景的方向。为此,我们引入 Attention Pattern - Masked Autoencoder(AP-MAE),这是一种基于视觉转换器的模型,能够高效重建被遮盖的注意力模式。在 StarCoder2 上的实验表明,AP-MAE (i) 以高精度重建被遮盖的注意力模式,(ii) 在最小退化的情况下跨模型泛化,(iii) 揭示推理中重复出现的模式,(iv) 在不访问 ground truth 的情况下预测生成是否正确,准确率在任务之间从 55% 到 70% 之间,以及 (v) 启用针对性干预可提高准确率 13.6%,但过度应用会导致崩溃。这些结果确立了注意力模式作为可扩展解释信号,并表明 AP-MAE 为大型语言模型中的分析和干预提供了可迁移的基础。除其独立价值之外,AP-MAE 还作为细粒度 mechanistic 方法的选择程序。我们发布代码和模型以支持未来的大规模解释工作。
引用
@article{arxiv.2604.03764,
title = {Automated Attention Pattern Discovery at Scale in Large Language Models},
author = {Jonathan Katzy and Razvan-Mihai Popescu and Erik Mekkes and Arie van Deursen and Maliheh Izadi},
journal= {arXiv preprint arXiv:2604.03764},
year = {2026}
}
备注
Accepted to TMLR