机器学习中单个数据点价值的比例规律
机器学习
2024-06-03 v1
摘要
最近的研究表明,机器学习模型会以可预测的速度改进,这些比例规律描述了错误与数据集大小之间的关系。这些比例规律有助于设计模型的训练数据集,但通常仅考虑数据集的大小,采取数据聚合的视角。我们提出了一种新视角,通过研究单个数据点的价值比例行为来进行调查:我们发现,单个数据点的对模型性能的贡献会以对数线性方式随数据集大小的增大而缩小。有趣的是,不同数据点之间的比例指数存在显著差异,这表明某些数据点在小数据集中更有价值,而其他数据点在大数据集中更有用。我们提供学习理论以支持我们的比例规律,并观察到它在不同模型类别中都成立。我们进一步提出了最大似然估计器和 amortized 估计器,以高效地从每个数据点的少量噪声观察中学习个性化的比例行为。使用我们的估计器,我们提供了影响不同数据点比例行为的因素的见解。最后,我们演示了将个性化比例规律应用于数据定价和数据子集选择的应用。总体而言,我们的工作是理解和利用单个数据点价值比例属性的第一步。
引用
@article{arxiv.2405.20456,
title = {Scaling Laws for the Value of Individual Data Points in Machine Learning},
author = {Ian Covert and Wenlong Ji and Tatsunori Hashimoto and James Zou},
journal= {arXiv preprint arXiv:2405.20456},
year = {2024}
}
备注
ICML 2024 camera-ready