中文

迈向可信的数据蒸馏

机器学习 2024-08-13 v2 计算机视觉与模式识别

摘要

效率与可信度是将深度学习应用于实际场景时的两大永恒追求。在效率方面,数据蒸馏(DD)致力于通过将大型数据集蒸馏为极小的合成数据集来降低训练成本。然而,现有方法仅关注封闭世界设定下的分布内(InD)分类,忽视了分布外(OOD)样本。另一方面,OOD检测旨在提升模型的可信度,但在全数据设定下其实现效率往往低下。我们首次同时考虑这两个问题,提出了一种称为可信数据蒸馏(TrustDD)的新范式。通过蒸馏InD样本与离群点,浓缩后的数据集能够训练出同时胜任InD分类与OOD检测的模型。为缓解对真实离群数据的需求,我们进一步提出对InD样本施加腐蚀以生成伪离群点,即伪离群暴露(POE)。在不同设定下的综合实验证明了TrustDD的有效性,且POE超越了当前最优方法离群暴露(OE)。与先前的数据蒸馏相比,TrustDD更具可信度,并适用于开放世界场景。我们的代码已发布于 https://github.com/mashijie1028/TrustDD

关键词

引用

@article{arxiv.2307.09165,
  title  = {Towards Trustworthy Dataset Distillation},
  author = {Shijie Ma and Fei Zhu and Zhen Cheng and Xu-Yao Zhang},
  journal= {arXiv preprint arXiv:2307.09165},
  year   = {2024}
}

备注

Accepted to Pattern Recognition 2024