利用非负逐样本 Fisher 分解揭示模型处理策略
机器学习
2025-05-12 v2
摘要
我们提出 NPEFF(非负逐样本 Fisher 分解,Non-Negative Per-Example Fisher Factorization),一种旨在揭示模型生成预测时所使用策略的可解释性方法。NPEFF 使用一种新颖的分解算法对逐样本 Fisher 矩阵进行分解,该算法学习一组由学习到的秩-1 半正定矩阵表示的成分。通过人工评估与自动化分析相结合,我们证明这些 NPEFF 成分对应于多种语言模型与文本处理任务中的模型处理策略。我们进一步展示如何由 NPEFF 成分构造参数扰动,以选择性地破坏给定成分在模型处理中的作用。在开展大量消融研究的同时,我们包含实验以展示 NPEFF 如何用于分析并缓解机器遗忘(unlearning)的连带效应,并使用 NPEFF 研究上下文学习(in-context learning)。此外,我们展示了 NPEFF 相对于梯度聚类和在模型激活上使用稀疏自编码器进行字典学习等基线的优势。
引用
@article{arxiv.2310.04649,
title = {Uncovering Model Processing Strategies with Non-Negative Per-Example Fisher Factorization},
author = {Michael Matena and Colin Raffel},
journal= {arXiv preprint arXiv:2310.04649},
year = {2025}
}