中文

无需模型训练的数据估值

机器学习 2023-03-08 v2

摘要

许多近期关于理解深度学习的工作试图量化个体数据实例对模型优化与泛化的影响。此类尝试揭示了个体实例的特征与重要性,可为诊断与改进深度学习提供有用信息。然而,现有大多数数据估值工作需实际训练模型,往往计算成本高昂。本文提供一种免训练的数据估值分数,称为复杂度间隙分数,这是一种以数据为中心的分数,用于量化个体实例在两层过参数化神经网络泛化中的影响。所提分数可量化实例的不规则性,并衡量每个数据实例在训练期间网络参数总移动中的贡献。我们从理论上分析并实证展示了复杂度间隙分数在发现“不规则或误标”数据实例上的有效性,并给出了该分数在分析数据集与诊断训练动态中的应用。我们的代码公开于 https://github.com/JJchy/CG_score

关键词

引用

@article{arxiv.2301.00930,
  title  = {Data Valuation Without Training of a Model},
  author = {Nohyun Ki and Hoyong Choi and Hye Won Chung},
  journal= {arXiv preprint arXiv:2301.00930},
  year   = {2023}
}

备注

ICLR 2023