中文

已发表多标签分类器性能度量与简单多标签基线分类器所得度量的比较

机器学习 2015-03-25 v1

摘要

在监督学习中,简单的基线分类器可以仅通过查看类别来构建,即忽略数据集中的任何其他信息。单标签学习界经常使用总是预测多数类的分类器作为参考。尽管某个分类器的性能可能比该简单基线分类器更差,这种行为需要特殊解释。为了激励学界将实验结果与多标签基线分类器提供的结果进行比较,并提请注意那些性能劣于基线的分类器需要特殊解释,本工作中我们提出使用General_B,一种多标签基线分类器。General_B与文献中发表的结果进行了对比评估,这些结果通过系统综述过程仔细筛选。研究发现,在10个常用数据集上相当数量的已发表结果劣于或等于General_B所获得的结果,且对于其中一个数据集,这一比例达到该数据集已发表结果的43%。此外,尽管这些出版物未考虑简单基线分类器,但观察到即使对于非常差的结果,其中大多数也未提供特殊解释。我们希望本工作的发现将鼓励多标签学界考虑使用简单基线分类器的想法,从而在分类器性能劣于基线时提供进一步的解释。

关键词

引用

@article{arxiv.1503.06952,
  title  = {Comparing published multi-label classifier performance measures to the ones obtained by a simple multi-label baseline classifier},
  author = {Jean Metz and Newton Spolaôr and Everton A. Cherman and Maria C. Monard},
  journal= {arXiv preprint arXiv:1503.06952},
  year   = {2015}
}

备注

19 pages, 8 figures, 7 tables