中文

影响函数度量群体效应的准确性探究

机器学习 2019-11-22 v2 机器学习

摘要

影响函数无需重新训练即可估计移除一个训练点对模型的影响。它们基于一阶泰勒近似,该近似在模型变化足够小时保证准确,因此常用于研究大型数据集中单个点的影响。然而,我们常常希望研究大型训练点群体的影响,例如诊断批次效应或在不同数据源之间分配贡献。移除此类大型群体可能导致模型的显著变化。在此设定下影响函数仍然准确吗?在本文中,我们发现,在许多不同类型的群体和一系列真实世界数据集中,一个群体的预测影响(使用影响函数)与其实际影响的相关性出乎意料地好,即使绝对误差和相对误差很大。我们的理论分析表明,这种强相关性仅在特定设定下出现,且未必普遍成立,这表明真实世界数据集具有允许影响近似准确的特殊性质。

关键词

引用

@article{arxiv.1905.13289,
  title  = {On the Accuracy of Influence Functions for Measuring Group Effects},
  author = {Pang Wei Koh and Kai-Siang Ang and Hubert H. K. Teo and Percy Liang},
  journal= {arXiv preprint arXiv:1905.13289},
  year   = {2019}
}