中文

基于自适应抽样的主动学习数据集量化

计算机视觉与模式识别 2024-07-11 v1

摘要

深度学习最近取得了显著进展,这在很大程度上归功于大型标记数据集的可用性。然而,对此类数据集进行训练会提升成本和计算需求。为此,文献中探索了 various techniques 如核心集选择、数据提炼和数据集量化。与依赖不同类别中统一样本分布的传统技术不同,我们的研究表明,即使分布不均匀,仍可维持性能。我们发现,对于某些类别,样本数量的差异对性能影响最小。从而启发出一个直观想法:减少稳定类别的样本数量,增加敏感类别的样本数量,以在相同的抽样比例下实现更好的性能。然后问题随之而来:如何进行自适应抽样以实现最佳性能?本文提出了一种 novel active learning based adaptive sampling strategy,称为 Dataset Quantization with Active Learning based Adaptive Sampling (DQAS),以优化样本选择。此外,我们引入了一种 novel pipeline for dataset quantization,利用 dataset quantization 最终阶段的特征空间生成更精确的数据集 bin。我们的全面评估表明,该方法在多个数据集上优于 state-of-the-art dataset compression methods。

关键词

引用

@article{arxiv.2407.07268,
  title  = {Dataset Quantization with Active Learning based Adaptive Sampling},
  author = {Zhenghao Zhao and Yuzhang Shang and Junyi Wu and Yan Yan},
  journal= {arXiv preprint arXiv:2407.07268},
  year   = {2024}
}

备注

Accepted to ECCV 2024