中文

基于文本特征的两级分类方法用于检测标题党帖子

社会与信息网络 2017-10-25 v1 计算与语言

摘要

社交媒体作为新闻来源的兴起导致了标题党帖子的增加,试图吸引用户点击文章链接而不告知实际文章内容。本文介绍了我们受假新闻检测算法启发创建标题党检测器以及提交给Clickbait Challenge 2017的努力。该检测器几乎完全基于取自先前标题党检测工作、我们自己的假帖子检测工作以及我们专门为挑战设计的特征的基于文本的特征。我们使用两级分类方法,将65个一级分类器的输出组合进一个二级特征向量中。我们展示了使用来自帖子文本和目标文章标题的单个特征及其组合以及特征选择的探索性结果。虽然我们用数据集进行的盲测得到了0.63的F值,但我们在挑战中的最终评估仅达到0.43的F值。我们探究了这一现象的可能原因,并提出了未来取得更成功结果的潜在步骤。

关键词

引用

@article{arxiv.1710.08528,
  title  = {A Two-Level Classification Approach for Detecting Clickbait Posts using Text-Based Features},
  author = {Olga Papadopoulou and Markos Zampoglou and Symeon Papadopoulos and Ioannis Kompatsiaris},
  journal= {arXiv preprint arXiv:1710.08528},
  year   = {2017}
}

备注

Clickbait Challenge 2017