中文

度量数据集粒度

计算机视觉与模式识别 2019-12-24 v1 机器学习

摘要

尽管细粒度识别在领域中日益受到关注,但“细粒度”迄今缺乏精确定义。本文基于聚类理论,构建了一个度量数据集粒度的框架。我们认为数据集粒度不仅应取决于数据样本及其标签,还应取决于所选择的距离函数。我们提出一个公理化框架以捕获数据集粒度度量应具备的性质,并给出满足这些性质的度量示例。我们在具有不同粒度层次标签的数据集上通过实验评估了各度量。使用我们的度量对常用数据集进行粒度度量时,我们发现某些被广泛视为细粒度的数据集实际上包含相当规模的子集,其粗粒度程度明显高于通常被视为粗粒度的数据集。我们还研究了数据集粒度与多种因素的相互作用,发现细粒度数据集更难以学习、更难以迁移、更难以进行少样本学习,且更易受对抗攻击。

关键词

引用

@article{arxiv.1912.10154,
  title  = {Measuring Dataset Granularity},
  author = {Yin Cui and Zeqi Gu and Dhruv Mahajan and Laurens van der Maaten and Serge Belongie and Ser-Nam Lim},
  journal= {arXiv preprint arXiv:1912.10154},
  year   = {2019}
}

备注

Code is available at: https://github.com/richardaecn/dataset-granularity