骚扰检测:基于 #HackHarassment 数据集的基准测试
计算与语言
2016-09-12 v1
摘要
自互联网早期以来,在线骚扰一直在不同程度上成为一个问题。先前的工作已将基于机器学习的文本分类等反垃圾邮件技术(Reynolds, 2011)应用于检测骚扰信息。然而,现有的公开数据集在规模上有限,且标签质量参差不齐。#HackHarassment 倡议(由致力于打击网络欺凌的科技公司和非政府组织组成的联盟)已开始通过创建一个在规模和质量上均优于以往的新数据集来解决此问题。随着我们(#HackHarassment)完成进一步的标注轮次,该数据集的后续迭代将使可用样本增加至少一个数量级,从而相应地提升骚扰检测机器学习模型的质量。在本文中,我们介绍了基于 #HackHarassment 数据集 v1.0(一个新的开放数据集,我们很乐意与任何感兴趣的研究人员分享)构建的首批模型,作为未来研究的基准。
引用
@article{arxiv.1609.02809,
title = {Harassment detection: a benchmark on the #HackHarassment dataset},
author = {Alexei Bastidas and Edward Dixon and Chris Loo and John Ryan},
journal= {arXiv preprint arXiv:1609.02809},
year = {2016}
}
备注
Accepted to the Collaborative European Research Conference 2016