推理时激活分解(ITDA):一种可扩展的大语言模型解释方法
机器学习
2025-06-13 v2
摘要
稀疏自编码器(SAEs)是分解大型语言模型激活的流行方法。然而,由于其巨大的训练成本,大多数学术研究使用仅可用于最多27B参数模型的开源SAEs。SAEs的激活潜在值也从激活数据集中学习,这意味着它们不会在模型之间传递。以相对表示相似性度量为动机,我们引入推理时激活分解(ITDA)模型,一种分解语言模型激活的替代方法。要训练ITDA,我们greedily构建一个语言模型激活字典,选择那些在匹配 pursuit on existing dictionary 上被最糟糕近似的激活。在ITDA上训练只需SAEs的1%的时间,使用1%的数据。这使我们能够在单个消费级GPU上训练Llama-3.1 70B和405B的ITDA。ITDA在某些目标LLM上可以实现与SAEs相似的重建性能,但通常会产生性能惩罚。然而,ITDA字典实现了跨模型比较,ITDA字典上简单的Jaccard相似度指数优于现有方法如CKA、SVCCA和相对表示相似性度量。ITDA是在计算资源有限或需要跨模型比较时SAEs的廉价替代方案。代码可在 https://github.com/pleask/itda 获取。
引用
@article{arxiv.2505.17769,
title = {Inference-Time Decomposition of Activations (ITDA): A Scalable Approach to Interpreting Large Language Models},
author = {Patrick Leask and Neel Nanda and Noura Al Moubayed},
journal= {arXiv preprint arXiv:2505.17769},
year = {2025}
}
备注
ICML 2025