Twitter滥用语言检测的一步与两步分类
计算与语言
2017-06-06 v1
摘要
自动滥用语言检测对于在线社交媒体而言是一项困难但重要的任务。我们的研究探索了一种两步方法,即先对滥用语言进行分类,再将其分类为具体类型,并将其与一步方法(即通过一次多类分类来检测性别歧视和种族歧视语言)进行了比较。利用一个包含2万条推文的公开英语Twitter语料库(涉及性别歧视和种族歧视类型),我们的方法在一步法中使用HybridCNN取得了0.827的F-measure,在两步法中使用逻辑回归取得了0.824的F-measure,展现出良好的性能。
引用
@article{arxiv.1706.01206,
title = {One-step and Two-step Classification for Abusive Language Detection on Twitter},
author = {Ji Ho Park and Pascale Fung},
journal= {arXiv preprint arXiv:1706.01206},
year = {2017}
}
备注
ALW1: 1st Workshop on Abusive Language Online to be held at the annual meeting of the Association of Computational Linguistics (ACL) 2017 (Vancouver, Canada), August 4th, 2017