中文

DIVA:学习任务的数据集导数

机器学习 2021-11-19 v1

摘要

我们提出一种计算学习任务相对于数据集的导数的方法。学习任务是一个从训练集到验证误差的函数,可由训练好的深度神经网络(DNN)表示。“数据集导数”是一个线性算子,在训练好的模型附近计算,它指示每个训练样本权重的扰动如何影响验证误差(通常在独立的验证数据集上计算)。我们的方法DIVA(可微验证,Differentiable Validation)依赖于围绕预训练DNN的留一交叉验证误差的闭式可微表达式。该表达式即构成数据集导数。DIVA可用于数据集自动整理,例如移除带有错误标注的样本、用额外的相关样本扩充数据集或重新平衡。更一般地,DIVA可用于优化数据集以及模型参数,作为训练过程的一部分,而无需独立的验证数据集,这不同于AutoML中常见的双层优化方法。为说明DIVA的灵活性,我们报告了样本自动整理任务上的实验,如离群点剔除、数据集扩展和多模态数据的自动聚合。

关键词

引用

@article{arxiv.2111.09785,
  title  = {DIVA: Dataset Derivative of a Learning Task},
  author = {Yonatan Dukler and Alessandro Achille and Giovanni Paolini and Avinash Ravichandran and Marzia Polito and Stefano Soatto},
  journal= {arXiv preprint arXiv:2111.09785},
  year   = {2021}
}