中文

LAVA:无需预指定学习算法的数据估值

机器学习 2023-12-21 v3 人工智能 机器学习

摘要

传统上,数据估值(DV)被构成为将学习算法的验证性能在训练数据中公平分配的问题。因此,计算所得数据值依赖于底层学习算法的许多设计选择。然而,这种依赖性对于许多DV用例是不利的,例如在数据获取过程中为不同数据源设定优先级,以及为数据市场提供定价机制参考。在这些场景中,数据需在实际分析之前被估值,而那时学习算法的选择尚未确定。该依赖的另一副作用是,为评估单个数据点的价值,需在使用和不使用该点的情况下重新运行学习算法,这带来了巨大的计算负担。本工作通过引入一种新框架跃过当前数据估值方法的局限,该框架能以对下游学习算法不可知的方式为训练数据估值。我们的主要结果如下。(1)我们基于训练集与验证集之间非传统的类间 Wasserstein 距离,开发了与训练集相关的验证性能代理。我们证明该距离在某些 Lipschitz 条件下刻画了任意给定模型验证性能的上界。(2)我们基于类间 Wasserstein 距离的敏感性分析开发了评估单个数据价值的新方法。重要的是,这些数值可在计算距离时直接从现成优化求解器的输出中免费获得。(3)我们在涉及检测低质量数据的多种用例上评估了新数据估值框架,并惊讶地发现,我们框架的学习无关特性在实现比 SOTA 性能显著提升的同时,速度还快了数个数量级。

关键词

引用

@article{arxiv.2305.00054,
  title  = {LAVA: Data Valuation without Pre-Specified Learning Algorithms},
  author = {Hoang Anh Just and Feiyang Kang and Jiachen T. Wang and Yi Zeng and Myeongseob Ko and Ming Jin and Ruoxi Jia},
  journal= {arXiv preprint arXiv:2305.00054},
  year   = {2023}
}

备注

ICLR 2023 Spotlight Latest Updated Version: 2023/12/19