用机器学习检测新闻中的讽刺内容
计算与语言
2018-10-02 v1
摘要
我们在一个由常规新闻文章和来自讽刺性网站的新闻组成的大型数据集上,用逻辑回归和线性支持向量机构建了模型,并表明在约 60,000 篇文章的语料上,此类线性分类器在新闻的随机测试集上可达到 98.7% 的精确率和 95.2% 的召回率。另一方面,当在训练期间完全未知的“发布来源”上测试分类器时,仅达到 88.2% 的准确率和 76.3% 的 F1 分数。作为另一结果,我们表明同一算法可区分新闻机构自身撰写的新闻与客户的付费文章。此处结果具有 99% 的准确率。
引用
@article{arxiv.1810.00593,
title = {Detecting Satire in the News with Machine Learning},
author = {Andreas Stöckl},
journal= {arXiv preprint arXiv:1810.00593},
year = {2018}
}