新闻文章毒性检测:在保加利亚语上的应用
计算与语言
2019-08-27 v1 信息检索
摘要
网络媒体旨在触及尽可能广泛的受众并吸引尽可能长的注意力时长。这种竞争创造了一种奖励耸动、虚假和有毒新闻的环境。为帮助限制其传播和影响,我们提出并开发了一个可识别各类有毒内容的新闻毒性检测器。先前的研究主要关注英语,而此处我们以保加利亚语为目标。我们通过爬取一个五年来持续收集并被人工分类为八类毒性组的保加利亚语新闻文章的网站,创建了一个新数据集。随后我们训练了一个包含九类(八类有毒和一类无毒)的多类分类器。我们基于 ElMo、BERT 和 XLM 的不同表示以及多种领域特定特征进行了实验。由于数据集规模较小,我们为每种特征类型创建了单独的模型,并最终将这些模型组合为一个元分类器。评估结果显示准确率为 59.0%,宏 F1 得分为 39.7%,相比多数类基线(准确率=30.3%,宏 F1=5.2%)有显著提升。
引用
@article{arxiv.1908.09785,
title = {Detecting Toxicity in News Articles: Application to Bulgarian},
author = {Yoan Dinkov and Ivan Koychev and Preslav Nakov},
journal= {arXiv preprint arXiv:1908.09785},
year = {2019}
}
备注
Fact-checking, source reliability, political ideology, news media, Bulgarian, RANLP-2019. arXiv admin note: text overlap with arXiv:1810.01765