迈向可信的数据蒸馏
机器学习
2024-08-13 v2 计算机视觉与模式识别
摘要
效率与可信度是将深度学习应用于实际场景时的两大永恒追求。在效率方面,数据蒸馏(DD)致力于通过将大型数据集蒸馏为极小的合成数据集来降低训练成本。然而,现有方法仅关注封闭世界设定下的分布内(InD)分类,忽视了分布外(OOD)样本。另一方面,OOD检测旨在提升模型的可信度,但在全数据设定下其实现效率往往低下。我们首次同时考虑这两个问题,提出了一种称为可信数据蒸馏(TrustDD)的新范式。通过蒸馏InD样本与离群点,浓缩后的数据集能够训练出同时胜任InD分类与OOD检测的模型。为缓解对真实离群数据的需求,我们进一步提出对InD样本施加腐蚀以生成伪离群点,即伪离群暴露(POE)。在不同设定下的综合实验证明了TrustDD的有效性,且POE超越了当前最优方法离群暴露(OE)。与先前的数据蒸馏相比,TrustDD更具可信度,并适用于开放世界场景。我们的代码已发布于 https://github.com/mashijie1028/TrustDD
引用
@article{arxiv.2307.09165,
title = {Towards Trustworthy Dataset Distillation},
author = {Shijie Ma and Fei Zhu and Zhen Cheng and Xu-Yao Zhang},
journal= {arXiv preprint arXiv:2307.09165},
year = {2024}
}
备注
Accepted to Pattern Recognition 2024