中文

影响函数作用的理论与实践视角

机器学习 2023-05-29 v1

摘要

影响函数(IF)一直被视为通过训练数据视角解释模型预测的技术。其效用被假定为识别“负责”某一预测的训练样本,从而例如可以通过干预这些样本(移除或编辑它们)并重新训练模型来纠正预测。然而,近期实证研究已表明,现有的IF估计方法对留一重训练效应的预测很差。为理解理论承诺与实际结果之间的不匹配,我们分析了IF方法所做的五个假设,这些假设对现代规模的深度神经网络存在问题,涉及凸性、数值稳定性、训练轨迹和参数发散。这使我们能够澄清IF在理论上可期望什么。我们表明,虽然大多数假设可成功处理,但参数发散对IF的预测能力构成了明确限制:即使采用确定性训练,影响也会随训练时间衰减。我们用BERT和ResNet模型说明了这一理论结果。理论分析的另一个结论是,尽管先前工作所做的某些假设不成立,IF仍可用于模型调试与纠正:利用自然语言处理和计算机视觉任务,我们验证了通过对有影响的样本仅进行几步微调即可成功纠正错误预测。

关键词

引用

@article{arxiv.2305.16971,
  title  = {Theoretical and Practical Perspectives on what Influence Functions Do},
  author = {Andrea Schioppa and Katja Filippova and Ivan Titov and Polina Zablotskaia},
  journal= {arXiv preprint arXiv:2305.16971},
  year   = {2023}
}