OpenDataVal:一个统一的数据估值基准
机器学习
2023-10-16 v3 机器学习
摘要
评估单个数据点的质量与影响对于提升模型性能以及缓解训练数据集中的不良偏置至关重要。已有若干数据估值算法被提出以量化数据质量,然而目前缺乏一个系统且标准化的数据估值基准。本文中,我们介绍了 OpenDataVal,一个易于使用且统一的基准框架,使研究者和从业者能够应用并比较各种数据估值算法。OpenDataVal 提供了一个集成环境,包括(i)多样化的图像、自然语言与表格数据集集合,(ii)十一种不同最先进数据估值算法的实现,以及(iii)可导入 scikit-learn 中任意模型的预测模型 API。此外,我们提出了四项下游机器学习任务用于评估数据值的质量。我们利用 OpenDataVal 进行基准分析,量化并比较最先进数据估值方法的有效性。我们发现没有任何单一算法能在所有任务上一致地表现最佳,用户应根据其下游任务选用合适的算法。OpenDataVal 已在 https://opendataval.github.io 公开提供,并附有完整文档。此外,我们提供了一个排行榜,研究者可在其上评估其自有数据估值算法的有效性。
引用
@article{arxiv.2306.10577,
title = {OpenDataVal: a Unified Benchmark for Data Valuation},
author = {Kevin Fu Jiang and Weixin Liang and James Zou and Yongchan Kwon},
journal= {arXiv preprint arXiv:2306.10577},
year = {2023}
}
备注
25 pages, NeurIPS 2023 Track on Datasets and Benchmarks