面向数据集选择与凝缩的损失曲率匹配
机器学习
2023-03-09 v1 人工智能
计算机视觉与模式识别
摘要
在大型数据集上训练神经网络需要大量的计算成本。数据集约简基于大型数据集选择或合成数据实例,同时最小化完整数据集在泛化性能上的退化。现有方法在数据集约简过程中利用神经网络,因此模型参数成为约简后保持性能的重要因素。鉴于参数的重要性,本文提出一种新的约简目标,称为 LCMat,它在模型参数空间上匹配原始数据集与约简数据集的损失曲率(loss curvature),而非仅匹配参数点。这一新目标使约简数据集在受扰动的参数区域上比精确点匹配具有更好的适应性。特别地,我们确定了来自局部参数区域的损失曲率差距的最坏情况,并通过理论分析推导了该最坏情况的可实现上界。我们在核心集选择(coreset selection)与凝缩基准上的实验表明,LCMat 比现有基线具有更好的泛化性能。
引用
@article{arxiv.2303.04449,
title = {Loss-Curvature Matching for Dataset Selection and Condensation},
author = {Seungjae Shin and Heesun Bae and Donghyeok Shin and Weonyoung Joo and Il-Chul Moon},
journal= {arXiv preprint arXiv:2303.04449},
year = {2023}
}
备注
26th International Conference on Artificial Intelligence and Statistics (AISTATS)