SelMatch:通过选择初始化和轨迹匹配的部分更新有效扩展数据蒸馏
计算机视觉与模式识别
2024-06-28 v1 机器学习
摘要
数据蒸馏旨在从大数据集中合成少量每类图像(IPC)来近似完整数据集训练,同时保持最小性能损失。虽然在非常小的IPC范围内效果良好,但许多蒸馏方法在IPC增加时会变得不够有效,甚至不及随机样本选择。我们对各类IPC尺度范围内最新基于轨迹匹配的蒸馏方法进行的检查揭示,这些方法在将复杂、罕见的难样本特征纳入合成数据集方面困难重重,即使IPC增加,也导致合成数据集与难测试样本之间存在持久的覆盖差距。以此为启发,我们引入SelMatch,这是一种新型蒸馏方法,有效地随着IPC的增加而扩展。SelMatch使用选择初始化和通过轨迹匹配的部分更新来管理合成数据集的所需难度水平,以适应IPC尺度。我们在CIFAR-10/100和TinyImageNet上进行的测试表明,SelMatch在5%至30%的子集比例下持续领先于领先的仅选择和仅蒸馏方法。
引用
@article{arxiv.2406.18561,
title = {SelMatch: Effectively Scaling Up Dataset Distillation via Selection-Based Initialization and Partial Updates by Trajectory Matching},
author = {Yongmin Lee and Hye Won Chung},
journal= {arXiv preprint arXiv:2406.18561},
year = {2024}
}
备注
ICML 2024