AtP*:一种将 LLM 行为定位到组件的高效可扩展方法
机器学习
2024-03-04 v1 计算与语言
摘要
激活补丁(Activation Patching)是一种直接计算行为对模型组件因果归因的方法。然而,穷尽地应用该方法需要进行的扫描成本随模型组件数量线性增长,这对于最先进的的大型语言模型(LLM)来说可能过于昂贵。我们研究了归因补丁(Attribution Patching, AtP),这是一种针对激活补丁的快速基于梯度的近似方法,并发现了 AtP 的两类失效模式,这些模式会导致显著的假阴性。我们提出了一种名为 AtP* 的 AtP 变体,通过两项改进来解决这些失效模式,同时保持可扩展性。我们首次对 AtP 及用于加速激活补丁的替代方法进行了系统研究,结果表明 AtP 显著优于所有其他 investigated 方法,而 AtP* 提供了进一步的显著改进。最后,我们提供了一种方法来界定 AtP* 估计中剩余假阴性的概率。
引用
@article{arxiv.2403.00745,
title = {AtP*: An efficient and scalable method for localizing LLM behaviour to components},
author = {János Kramár and Tom Lieberum and Rohin Shah and Neel Nanda},
journal= {arXiv preprint arXiv:2403.00745},
year = {2024}
}