充分利用推文固有特征用于Twitter上的社交垃圾检测
信息检索
2015-03-26 v1 社会与信息网络
摘要
社交垃圾在Twitter等社交媒体服务上产生大量噪声,降低了终端用户和数据挖掘应用所观察到的信噪比。现有的社交垃圾检测技术主要侧重于利用广泛的历史和基于网络的数据来识别垃圾账号。在本文中,我们关注垃圾推文的检测,其仅依赖推文固有特征来优化需收集的数据量。这使得垃圾检测系统能够及时应用于大量推文,潜在适用于实时或近实时环境。使用两个包含垃圾推文的大型人工标注数据集,我们研究了五种分类算法和四种不同特征集对社交垃圾检测任务的适用性。我们的结果表明,通过使用推文中随时可用的有限特征集,我们可以取得令人鼓舞的结果,与利用额外的、昂贵的用户特征的现有垃圾账号检测系统相比具有竞争力。我们的研究是首次尝试在不同数据集上泛化关于社交垃圾检测的最优分类器和特征集的结论。
引用
@article{arxiv.1503.07405,
title = {Making the Most of Tweet-Inherent Features for Social Spam Detection on Twitter},
author = {Bo Wang and Arkaitz Zubiaga and Maria Liakata and Rob Procter},
journal= {arXiv preprint arXiv:1503.07405},
year = {2015}
}