中文

GTZAN 数据集:其内容、缺陷、对评估的影响及未来使用

声音 2015-05-18 v2

摘要

GTZAN 数据集出现在至少 100 篇已发表著作中,是音乐流派识别(MGR)机器听觉研究中使用最广泛的公共评估数据集。然而,我们近期的工作表明 GTZAN 存在若干缺陷(重复、错误标注和失真),这对使用它得出的任何结果的可解释性提出了挑战。在本文中,我们驳斥了以下观点:所有 MGR 系统都以相同方式受到这些缺陷的影响,且由于所有系统都面临相同的缺陷,它们在 GTZAN 上的性能仍然具有可比意义。我们识别并分析了 GTZAN 的内容,提供了其缺陷目录。我们回顾了 GTZAN 在 MGR 研究中的使用情况,发现很少有迹象表明其缺陷已被知晓并予以考虑。最后,我们严格研究了其缺陷对评估五种不同 MGR 系统的影响。结论并非要摒弃 GTZAN,而是要在考虑其内容的前提下使用它。

关键词

引用

@article{arxiv.1306.1461,
  title  = {The GTZAN dataset: Its contents, its faults, their effects on evaluation, and its future use},
  author = {Bob L. Sturm},
  journal= {arXiv preprint arXiv:1306.1461},
  year   = {2015}
}

备注

29 pages, 7 figures, 6 tables, 128 references