基于高级抽样的可靠且快速影响函数
机器学习
2025-11-03 v2 人工智能
摘要
我们如何解释训练数据对黑箱模型的影响?影响函数(IF)提供了一种通过利用梯度和 Hessian 的后置解决方案。然而,对于整个数据集计算 Hessian 代价昂贵,迫切需要可行的替代方案。常见方法是随机抽取小型训练数据子集,但此方法常导致由于样本配置的高方差,IF 估计高度不一致。为此,我们提出两种基于特征和逻辑 logits 的高级抽样技术。这些抽样器通过考虑特征或逻辑 logits 的随机分布,选择小而具代表性的数据子集,从而提高 IF 估计的准确性。我们通过类别删除实验验证了我们的方案——这是 IF 的典型应用——使用 F1 分数衡量模型有效遗忘被删除类别的能力,同时保持对剩余类别的推断一致性。我们的方法将计算时间缩短 30.1%,内存使用减少 42.2%,或使 F1 分数提高 2.5%。
引用
@article{arxiv.2510.26776,
title = {Faithful and Fast Influence Function via Advanced Sampling},
author = {Jungyeon Koh and Hyeonsu Lyu and Jonggyu Jang and Hyun Jong Yang},
journal= {arXiv preprint arXiv:2510.26776},
year = {2025}
}