中文

大规模图像数据集的复杂度度量

计算机视觉与模式识别 2020-08-12 v1

摘要

大规模图像数据集是机器学习领域日益增长的趋势。然而,很难定量地理解或说明各数据集之间如何比较——即,相对于基于深度学习的网络,某一数据集是否更复杂或更难“学习”。本工作中,我们构建了一系列计算上相对简单的方法来度量数据集的复杂度。此外,我们提出一种方法以展示高维数据的可视化,从而辅助数据集的视觉比较。我们使用来自自动驾驶研究领域的四个数据集——Cityscapes、IDD、BDD 与 Vistas——给出分析。利用基于熵的度量,我们给出了这些数据集的排序复杂度,并与基于深度学习的既定排序进行了比较。

关键词

引用

@article{arxiv.2008.04431,
  title  = {Measures of Complexity for Large Scale Image Datasets},
  author = {Ameet Annasaheb Rahane and Anbumani Subramanian},
  journal= {arXiv preprint arXiv:2008.04431},
  year   = {2020}
}

备注

6 pages, 3 tables, 4 figures