面向难度可分离数据的类比例核心集选择
机器学习
2025-08-15 v2 人工智能
摘要
高质量训练数据对构建可靠且高效的机器学习系统至关重要。单次核心集选择通过修剪数据集来实现,同时保持或提高模型性能,通常依赖于基于训练动力学的数据难度评分。然而,大多数现有方法隐含地假设数据难度在类别内部呈均匀分布,忽略了不同类别间数据难度的变化。在本工作中,我们挑战了这一假设,通过展示在网络入侵检测和医学影像等领域,数据难度常常按类别聚类。我们将此正式化为类难度可分离性,并引入类难度可分离系数(CDSC)作为量化度量。我们证明,高 CDSC 值与类无关核心集方法性能下降相关,这些方法倾向于过度代表容易的多数类别,同时忽略稀有但信息丰富的类别。为此,我们引入了基于类的比例变体多种抽样策略。我们在覆盖安全和医疗领域的五个数据集上进行评估,结果表明我们的方法在各项指标上均实现了最先进的性能。例如,在 99% 极端剪枝率下,基于类的比例覆盖导向核心集选择(CCS-CP)在准确率下降仅 2.58%,精确率 0.49%,召回率 0.19%。相比之下,基于类的无关 CCS 基线(下一最佳方法)在准确率下降 7.59%,精确率 4.57%,召回率 4.11%。我们进一步表明,激进剪枝可提高噪声、不平衡和大规模数据集上的泛化能力。我们的结果凸显了在高风险场景中,显式建模类难度可分离性导致更有效、更稳健且更具可泛化性的数据修剪。
引用
@article{arxiv.2507.10904,
title = {Class-Proportional Coreset Selection for Difficulty-Separable Data},
author = {Elisa Tsai and Haizhong Zheng and Atul Prakash},
journal= {arXiv preprint arXiv:2507.10904},
year = {2025}
}
备注
This paper has been accepted to the ICCV 2025 Workshop on Curated Data for Efficient Learning (CDEL)