在多标签分类的标签空间划分中,数据驱动方法为何优于随机选择?
机器学习
2016-08-24 v1 性能
社会与信息网络
机器学习
摘要
我们提出使用来自社交网络的五种数据驱动的社区发现方法来对多标签分类任务的标签空间进行划分,以此替代 RAkELd 所执行的随机等分划分:最大化模块度的 fastgreedy 和 leading eigenvector、infomap、walktrap 以及标签传播算法。我们基于训练数据构建了标签共现图(包含加权和非加权版本),并进行社区发现以划分标签集。我们将 Binary Relevance 和 Label Powerset 分类方法纳入比较。我们使用基于基尼指数的决策树作为基分类器。我们在 12 个基准数据集上,通过五种评估指标将基于先验知识的标签空间划分方法与随机基线进行了比较。我们表明,在几乎所有情况下,七种基于先验猜测的方法在所有指标(Hamming Loss 除外)上比 RAkELd 表现更好的可能性更大。我们表明,在加权标签共现图上,fastgreedy 和 walktrap 社区发现方法获得更好 F1 分数的可能性比随机划分高 85% 至 92%。在非加权标签共现图上,就 Subset Accuracy 而言,Infomap 平均有 90% 的时间优于随机划分;就 Jaccard 相似度而言,该比例为 89%。在 Hamming Loss 方面,加权 fastgreedy 平均而言优于 RAkELd。
引用
@article{arxiv.1606.02346,
title = {How is a data-driven approach better than random choice in label space division for multi-label classification?},
author = {Piotr Szymański and Tomasz Kajdanowicz and Kristian Kersting},
journal= {arXiv preprint arXiv:1606.02346},
year = {2016}
}