中文

从海量矿石中提炼黄金:面向高效数据集蒸馏的双层数据剪枝

机器学习 2024-08-08 v4 人工智能 计算机视觉与模式识别

摘要

数据高效学习已引起显著关注,尤其在当前大规模多模态模型的趋势下。近期,数据集蒸馏通过合成对网络训练至关重要的数据样本成为一种有效方法。然而,哪些样本对数据集蒸馏过程本身至关重要仍有待探索。本工作中,我们研究数据集蒸馏任务中的数据效率与样本选择。通过重新形式化蒸馏的动态过程,我们从理论与实证上揭示了真实数据集中固有的冗余性。我们提出使用经验损失值作为静态数据剪枝准则。为进一步补偿数据价值在训练中的变化,我们基于样本对蒸馏的因果效应找出最具贡献的样本。所提选择策略能高效利用训练数据集,优于先前 SOTA 蒸馏算法,并持续增强蒸馏算法,即便在更大规模与更异构的数据集上,例如完整 ImageNet-1K 与 Kinetics-400。我们相信该范式将开启蒸馏动态研究的新途径,并为高效数据集蒸馏铺平道路。代码见 https://github.com/silicx/GoldFromOres-BiLP。

关键词

引用

@article{arxiv.2305.18381,
  title  = {Distill Gold from Massive Ores: Bi-level Data Pruning towards Efficient Dataset Distillation},
  author = {Yue Xu and Yong-Lu Li and Kaitong Cui and Ziyu Wang and Cewu Lu and Yu-Wing Tai and Chi-Keung Tang},
  journal= {arXiv preprint arXiv:2305.18381},
  year   = {2024}
}

备注

ECCV 2024