中文

基于数据重要性外推的对抗训练中的大规模数据集剪枝

机器学习 2024-07-12 v2

摘要

其对小且不可见攻击的脆弱性限制了深度学习模型在实际系统中的采纳。对抗训练已被证明是抵御这些攻击最具前景的策略,代价是训练时间的大幅增加。随着大规模合成数据的集成趋势,这一问题预计会进一步恶化。因此,一种以数据为中心、在保持准确性和鲁棒性的同时减少训练样本数量的方法就必然出现。虽然数据剪枝和主动学习是深度学习中的突出研究主题,但在对抗训练文献中仍未得到广泛探索。我们填补了这一空白,提出一种新的数据剪枝策略,基于从小数据集外推数据重要性分数到大数据集。在实证评估中,我们展示了外推式剪枝能够在保持鲁棒性的同时高效减少数据集大小。

关键词

引用

@article{arxiv.2406.13283,
  title  = {Large-Scale Dataset Pruning in Adversarial Training through Data Importance Extrapolation},
  author = {Björn Nieth and Thomas Altstidl and Leo Schwinn and Björn Eskofier},
  journal= {arXiv preprint arXiv:2406.13283},
  year   = {2024}
}

备注

8 pages, 5 figures, 3 tables, to be published in ICML: DMLR workshop