基于机器学习的社交媒体标题党帖子检测
计算与语言
2017-10-06 v1
摘要
标题党(标题)利用误导性标题,隐藏目标着陆页的关键信息或夸大其内容以诱导点击。由于标题党常使用博人眼球的措辞吸引受众,其目标内容往往质量低下。标题党在 Twitter 等社交媒体上尤为泛滥,通过引起极大的不满对用户体验产生负面影响。因此,提出一种广泛适用的方法来识别和检测标题党变得日益重要。本文使用了来自 2017 年标题党挑战赛(clickbait-challenge.com)的数据集,包含超过 21,000 个标题/题目,每个均由至少五次众包判定来标注其标题党程度。我们尝试在该数据集上构建有效的计算性标题党检测模型。我们首先考虑了共 331 个特征,滤除许多特征以避免过拟合并改善学习运行时间,最终为我们的最终模型选择了 60 个最重要的特征。使用这些特征,Random Forest Regression 取得了以下结果:MSE=0.035 MSE,Accuracy=0.82,且在标题党类别上 F1-score=0.61。
引用
@article{arxiv.1710.01977,
title = {Machine Learning Based Detection of Clickbait Posts in Social Media},
author = {Xinyue Cao and Thai Le and Jason and Zhang},
journal= {arXiv preprint arXiv:1710.01977},
year = {2017}
}