中文

Kaggle LSHTC4获胜方案

人工智能 2014-05-12 v2 计算与语言 信息检索

摘要

我们在2014年Kaggle大规模层次文本分类(LSHTC)竞赛中的获胜提交主要包括一个稀疏生成模型的集成,扩展了多项式朴素贝叶斯。基分类器由层次平滑模型组成,结合了文档、标签和层次级别的多项式,特征预处理使用TF-IDF和BM25的变体。通过不同类型的折叠和针对不同度量的随机搜索优化引入额外的多样化。集成算法通过预测每个标签的文档(而不是通常的每个文档预测标签)来优化macroFscore。文档的分数通过基分类器输出的加权投票(使用特征加权线性堆叠的变体)来预测。每个标签的文档数量使用标签先验和投票分数的阈值来选择。本文描述了用于构建我们解决方案的模型和软件。可以通过运行Kaggle包中包含的脚本来重现我们解决方案的结果。还分发了一个省略预计算结果文件的包。所有代码都是开源的,在GNU GPL 2.0下发布,Weka和Meka依赖项在GPL 3.0下发布。

关键词

引用

@article{arxiv.1405.0546,
  title  = {Kaggle LSHTC4 Winning Solution},
  author = {Antti Puurula and Jesse Read and Albert Bifet},
  journal= {arXiv preprint arXiv:1405.0546},
  year   = {2014}
}

备注

Kaggle LSHTC winning solution description