学习识别模糊与误导性的新闻标题
计算与语言
2017-08-30 v2 计算机与社会
摘要
准确性是新闻业的基本原则之一。然而,由于新闻媒体的多样化,这一原则越来越难以把控。一些在线新闻编辑倾向于使用吸引眼球的标题来诱使读者点击。这些标题或含糊其辞或具误导性,降低了读者的阅读体验。因此,识别不准确的新闻标题是一项值得研究的工作。先前工作将这些标题称为“clickbaits”,且主要关注从标题本身提取的特征,这限制了性能,因为标题与新闻正文之间的一致性未被充分重视。本文中,我们清晰地重新定义了该问题,并分别识别模糊与误导性标题。在检测模糊标题时,我们利用类序列规则来挖掘结构信息。对于误导性标题的识别,我们基于标题与正文之间的一致性提取特征。为利用大规模未标注数据集,我们应用了 co-training 方法并获得了性能提升。实验结果表明了我们所提方法的有效性。随后,我们使用分类器检测从不同的来源爬取的不准确标题,并进行了数据分析。
引用
@article{arxiv.1705.06031,
title = {Learning to Identify Ambiguous and Misleading News Headlines},
author = {Wei Wei and Xiaojun Wan},
journal= {arXiv preprint arXiv:1705.06031},
year = {2017}
}
备注
Accepted by IJCAI 2017