通过模拟模型权重评估样本效用以实现高效数据选择
机器学习
2026-05-27 v5 人工智能
摘要
大规模网络抓取数据集包含噪声、偏差和无关信息,需要数据选择技术。现有方法依赖于手工设计的启发式规则、下游数据集,或需要昂贵的基于影响的计算——所有限制了可扩展性并引入了不必要的数据依赖。为了解决这一问题,我们引入了 Mimic Score,这是一种简单且基于几何的数据质量度量,通过测量样本梯度与预训练参考模型诱导的目标方向之间的对齐程度来评估效用。该方法利用现成的模型权重,无需验证数据集,且产生最小的计算开销。基于该度量,我们提出了 Grad-Mimic,这是一个两阶段框架,在线重新加权样本以加速训练,并离线聚合样本效用以构建有效的数据过滤器。实验表明,使用 mimic scores 指导训练可提高数据效率,加速收敛,在六个图像数据集上产生一致的性能提升,并使 CLIP 模型减少 20.7% 的训练步数。此外,基于 mimic score 的过滤器增强了现有的过滤技术,使得训练改进的 CLIP 模型时减少了 470 万个样本。
引用
@article{arxiv.2501.06708,
title = {Evaluating Sample Utility for Efficient Data Selection by Mimicking Model Weights},
author = {Tzu-Heng Huang and Manjot Bilkhu and John Cooper and Frederic Sala and Javier Movellan},
journal= {arXiv preprint arXiv:2501.06708},
year = {2026}
}
备注
This work appears in the Proceedings of the 43rd International Conference on Machine Learning (ICML 2026) and was selected as an Oral paper at the ICML 2025 DataWorld Workshop