基于梯度相似性的数据估值
机器学习
2024-05-15 v1 基因组学
定量方法
机器学习
摘要
高质量数据对准确的机器学习和可操作的分析至关重要,但标签错误或噪声数据在许多领域都很常见。区分低于和高质量的数据常常需要专业知识和大量的手动干预。数据估值算法是一类旨在基于其对给定预测任务的贡献或重要性对数据集中每个样本进行定量评估的方法。这些数据价值已展现出识别标签错误观察值的强大能力,过滤低价值数据可提升机器学习性能。在本工作中,我们提出了一种现有方法的简单替代方案,称为基于梯度相似性的数据估值(DVGS)。该方法可轻松应用于任何梯度下降学习算法,能够扩展到大规模数据集,对诸如损坏标签发现和噪声定量等任务的性能与基准估值方法相当或更好。我们在表格、图像和 RNA 表达数据集上评估了 DVGS 方法,展示了该方法在不同领域中的有效性。我们的方法能够快速且准确地识别低质量数据,从而减少对数据清洗任务中专家知识和手动干预的需求。
引用
@article{arxiv.2405.08217,
title = {Data Valuation with Gradient Similarity},
author = {Nathaniel J. Evans and Gordon B. Mills and Guanming Wu and Xubo Song and Shannon McWeeney},
journal= {arXiv preprint arXiv:2405.08217},
year = {2024}
}