中文

用于在线毒性检测的机器学习套件

机器学习 2018-10-05 v1 计算与语言 神经与进化计算 机器学习

摘要

为识别并分类有毒的在线评论,现代数据科学工具将原始文本转化为关键特征,基于这些特征可通过阈值法或学习算法对攻击性对话进行监控预测。我们系统性地评估了代表 19 个主要算法族的 62 个分类器,针对从 Jigsaw 维基百科评论数据集中提取的特征。我们基于准确率和相对执行时间上的统计显著差异对这些分类器进行比较。在用于识别有毒评论的这些分类器中,基于树的算法提供了最具透明可解释性的规则,并对各特征的预测贡献进行排序。在句法、情感、情绪和离群词词典的 28 个特征中,一个简单的脏词表被证明对攻击性评论最具预测性。

关键词

引用

@article{arxiv.1810.01869,
  title  = {Machine Learning Suites for Online Toxicity Detection},
  author = {David Noever},
  journal= {arXiv preprint arXiv:1810.01869},
  year   = {2018}
}