中文

解耦数据剪枝中表征与选择的作用

计算与语言 2025-07-08 v1 机器学习

摘要

数据剪枝(data pruning)通过选择小而具影响力的子集,为高效扩展 NLP 模型训练提供了一种有前景的方法。然而,现有方法通常涉及许多不同的设计选择,这些选择尚未得到系统性研究。这限制了未来的发展。在这项工作中,我们将数据剪枝分解为两个关键组件:数据表征和选择算法,并系统性地分析它们对实例选择的影响。我们的理论和实证结果突出了表征的关键作用:更好的表征(例如训练梯度)通常会导致更好的实例选择,而不管选择何种选择算法。此外,不同的选择算法在不同的设置中各有优势,没有一种算法能始终优于其他算法。而且,选择算法并不总是与其预期目标一致:例如,为相同目标设计的算法可能会选择截然不同的实例,这凸显了仔细评估的必要性。

关键词

引用

@article{arxiv.2507.03648,
  title  = {Disentangling the Roles of Representation and Selection in Data Pruning},
  author = {Yupei Du and Yingjin Song and Hugh Mee Wong and Daniil Ignatev and Albert Gatt and Dong Nguyen},
  journal= {arXiv preprint arXiv:2507.03648},
  year   = {2025}
}

备注

ACL 2025