中文

CE-Dedup:基于图像去重的高性价比卷积神经网络训练

计算机视觉与模式识别 2021-09-03 v1

摘要

得益于不断增大的大规模图像数据集,卷积神经网络(CNNs)在基于视觉的任务中变得流行。通常认为更大的数据集有助于获得更高的网络训练精度,然而数据集质量的影响尚未被纳入考量。可以合理地假设数据集中存在近似重复图像。例如,街景门牌号(SVHN)数据集包含从门牌上裁剪出的0到9的数字,很可能来自相同或相似门牌的重复数字。冗余图像可能在未被察觉的情况下占据数据集的一定比重。这些重复图像对CNN训练精度几乎无贡献,却不必要地带来了额外的资源与计算消耗。为此,本文提出一种评估近似重复图像对CNN训练性能影响的框架,称为CE-Dedup。具体而言,CE-Dedup将基于哈希的图像去重方法与下游基于CNN的图像分类任务相结合。CE-Dedup通过调节去重阈值,在较高去重率与稳定精度之间取得平衡。CE-Dedup的有效性在知名CNN基准上通过大量实验得到验证。一方面,在保持相同验证精度的情况下,CE-Dedup可将数据集规模缩减23%。另一方面,当允许较小的验证精度下降(5%)时,CE-Dedup可将数据集规模削减75%。

关键词

引用

@article{arxiv.2109.00899,
  title  = {CE-Dedup: Cost-Effective Convolutional Neural Nets Training based on Image Deduplication},
  author = {Xuan Li and Liqiong Chang and Xue Liu},
  journal= {arXiv preprint arXiv:2109.00899},
  year   = {2021}
}