基于广义影响函数加深对黑盒预测的理解
机器学习
2024-05-07 v2 人工智能
摘要
影响函数阐明了训练数据如何改变模型行为。然而,大规模模型日益增长的规模和非凸性使得影响函数不准确。我们怀疑这种脆弱性源于一阶近似,这可能导致与所考察数据无关的参数发生干扰性变化。然而,仅从选定参数计算影响可能具有误导性,因为它未能消除未选定参数对所分析数据的隐藏影响。因此,我们的方法引入了广义影响函数,在消除固定参数上的干扰梯度变化的同时,精确估计目标参数的影响。我们通过基于输出和梯度的参数选择方法,识别与输入数据密切相关的目标更新参数。我们在类别移除和标签更改任务上,用各种影响函数的替代方案验证了广义影响函数。实验结果与“少即是多”的理念相符,表明仅更新 5% 的模型在所有任务中都能产生比其他影响函数更准确的结果。我们相信,我们的提案能够作为优化模型、进行数据分析以及超越影响函数局限性增强 AI 可解释性的基础工具。代码可在 https://github.com/hslyu/GIF 获取。
引用
@article{arxiv.2312.05586,
title = {Deeper Understanding of Black-box Predictions via Generalized Influence Functions},
author = {Hyeonsu Lyu and Jonggyu Jang and Sehyun Ryu and Hyun Jong Yang},
journal= {arXiv preprint arXiv:2312.05586},
year = {2024}
}
备注
16 pages, 6 figures, and 2 tables