中文

多样性驱动的合成:通过动态权重调整提升数据集蒸馏效果

机器学习 2024-11-20 v3 计算机视觉与模式识别

摘要

数据相关费用的快速上升推动了在保留最具信息特征的同时对数据集进行压缩的研究。因此,数据集蒸馏近年来受到关注。该范例会生成能够代表性足够的合成数据集,以取代原始数据集用于训练神经网络。为避免这些合成数据集中的冗余,关键在于每个元素在合成阶段包含独特特征且与其他元素保持多样性。本文对合成数据集中的多样性进行深入的理论与实证分析。我们认为,增强多样性可以改善具有可并行性但独立性的合成方法。具体而言,我们引入一种新方法,采用动态和有向的权重调整技术来调制合成过程,从而最大化每个合成实例的代表性和多样性。我们的 метод确保每个合成数据批次都反映原始数据集中大规模、变化子集的特征。广泛的实验包括 CIFAR、Tiny-ImageNet 和 ImageNet-1K,都显示我们方法的优越性能,突显其在产生具有最小计算开销的多样且具代表性的合成数据集方面的有效性。我们的代码可在 https://github.com/AngusDujw/Diversity-Driven-Synthesis 提供。

关键词

引用

@article{arxiv.2409.17612,
  title  = {Diversity-Driven Synthesis: Enhancing Dataset Distillation through Directed Weight Adjustment},
  author = {Jiawei Du and Xin Zhang and Juncheng Hu and Wenxin Huang and Joey Tianyi Zhou},
  journal= {arXiv preprint arXiv:2409.17612},
  year   = {2024}
}