中文

基于线性分类器的大规模破坏检测——WSDM Cup 2017 的 Conkerberry 破坏检测器

信息检索 2017-12-20 v1

摘要

如今许多人工智能系统依赖知识库来丰富其所处理的信息。此类知识库通常难以获取,因此采用众包方式:互联网上任何人都可以建议编辑和添加新信息。不幸的是,它们有时成为破坏者的目标,被放入不准确或冒犯性信息。这对使用这些知识库的系统尤为不利:它们需要使用可靠信息以做出正确推断。Wikidata 便是这样一种知识库,为打击破坏者,WSDM Cup 2017 的组织者挑战参赛者构建检测不信任编辑的模型。本文给出该竞赛亚军方案:我们展示使用简单线性分类即可获得有竞争力的性能。我们的方法在测试数据上可达到 0.938 的 AU ROC。此外,与其他方法相比,我们的方案显著更快。该方案已在 GitHub 上公开。

关键词

引用

@article{arxiv.1712.06920,
  title  = {Large-Scale Vandalism Detection with Linear Classifiers - The Conkerberry Vandalism Detector at WSDM Cup 2017},
  author = {Alexey Grigorev},
  journal= {arXiv preprint arXiv:1712.06920},
  year   = {2017}
}

备注

Vandalism Detector at WSDM Cup 2017, see arXiv:1712.05956