中文

通过优化训练数据集提高模型分类性能

机器学习 2025-07-23 v1

摘要

在数据中心AI时代,精心策划高质量训练数据的能力与模型设计同样关键。核集(Coresets)提供了原则化的数据压缩方法,通过重要抽样实现在大规模数据集上的高效学习。然而,常规的基于灵敏度的核集构建方法在针对分类性能指标(如F1分数)进行优化时常常不足,仅关注损失近似。在本工作中,我们提出了一个系统化的框架,用于调校核集生成过程以提升下游分类质量。该方法引入了新的可调参数——包括确定性抽样、类别分配以及通过主动抽样的细化,超越传统灵敏度得分。通过在多样化数据集和分类器上进行大量实验,我们展示调校后的核集在关键分类指标上显著优于原始核集和完整数据集训练,为更好更高效的模型训练提供了有效路径。

关键词

引用

@article{arxiv.2507.16729,
  title  = {Improving Model Classification by Optimizing the Training Dataset},
  author = {Morad Tukan and Loay Mualem and Eitan Netzer and Liran Sigalat},
  journal= {arXiv preprint arXiv:2507.16729},
  year   = {2025}
}