Merged-GHCIDR:一种用于缩减图像数据的几何方法
机器学习
2022-09-07 v1
摘要
自深度网络诞生以来,训练模型所需的计算资源不断增加。在大规模数据集上训练神经网络已成为一项具有挑战性且耗时的任务。因此,需要在不损害准确率的前提下缩减数据集。本文提出了一种早期方法“通过同质聚类缩减数据集”的新变体,用于减小数据集规模。所提方法基于将数据集划分为同质聚类并选择对准确率有显著贡献的图像这一思想。我们提出了两种变体:用于图像数据缩减的几何同质聚类(GHCIDR)和 Merged-GHCIDR,它们建立在基线算法“通过同质聚类缩减(RHC)”之上,以获得更好的准确率和训练时间。GHCIDR 背后的直觉涉及根据聚类权重和训练集的几何分布来选择数据点。Merged-GHCIDR 涉及使用完全联动聚类合并具有相同标签的聚类。我们使用了三种深度学习模型——全连接网络(FCN)、VGG1 和 VGG16。我们在四个数据集——MNIST、CIFAR10、Fashion-MNIST 和 Tiny-Imagenet 上实验了这两种变体。在与 RHC 相同缩减比例下,Merged-GHCIDR 在 MNIST、Fashion-MNIST、CIFAR10 和 Tiny-Imagenet 上的准确率分别提升了 2.8%、8.9%、7.6% 和 3.5%。
引用
@article{arxiv.2209.02609,
title = {Merged-GHCIDR: Geometrical Approach to Reduce Image Data},
author = {Devvrat Joshi and Janvi Thakkar and Siddharth Soni and Shril Mody and Rohan Patil and Nipun Batra},
journal= {arXiv preprint arXiv:2209.02609},
year = {2022}
}