针对直接对数归因的对抗样本:GELU-4L中的记忆管理
机器学习
2024-12-17 v4 人工智能
摘要
先前的研究表明,语言模型通过一种“记忆管理”机制来管理残差流有限的带宽,即特定的注意力头与MLP层清除由较早层设置的残差流方向。我们的研究在4层transformer中为该擦除现象提供了具体证据,识别出持续移除较早头输出的头。我们进一步证明,直接对数归因(DLA)——一种用于解释transformer中间层输出的常用技术——可能因未考虑擦除而显示出误导性结果。
引用
@article{arxiv.2310.07325,
title = {An Adversarial Example for Direct Logit Attribution: Memory Management in GELU-4L},
author = {Jett Janiak and Can Rager and James Dao and Yeu-Tong Lau},
journal= {arXiv preprint arXiv:2310.07325},
year = {2024}
}