重新审视逆海森向量积在影响力函数计算中的应用
机器学习
2024-09-27 v1
摘要
影响力函数是一种将模型输出归因于训练数据的流行方法。传统方法依赖于逆海森向量积(iHVP)的计算,但经典求解器“线性时间随机二阶算法”(LiSSA, Agarwal et al. (2017))常因计算昂贵和超参数调整困难而被认为不适用于大型模型。我们表明,三个超参数——缩放因子、批量大小和步数——可以根据海森矩阵的谱特性(特别是其迹和最大特征值)来选择。通过使用随机草图法(Swartworth and Woodruff, 2023)进行评估,我们发现批量大小必须足够大LiSSA才能收敛;然而,对于我们考虑的所有模型,该要求是温和的。我们通过与近端Bregman响应函数(PBRF, Bae et al. (2022))进行比较,实证验证了我们的发现。最后,我们讨论了逆海森矩阵在计算影响力中所起的作用。
引用
@article{arxiv.2409.17357,
title = {Revisiting inverse Hessian vector products for calculating influence functions},
author = {Yegor Klochkov and Yang Liu},
journal= {arXiv preprint arXiv:2409.17357},
year = {2024}
}
备注
23 pages, 7 figures, 4 tables