中文

学习识别模糊与误导性的新闻标题

计算与语言 2017-08-30 v2 计算机与社会

摘要

准确性是新闻业的基本原则之一。然而,由于新闻媒体的多样化,这一原则越来越难以把控。一些在线新闻编辑倾向于使用吸引眼球的标题来诱使读者点击。这些标题或含糊其辞或具误导性,降低了读者的阅读体验。因此,识别不准确的新闻标题是一项值得研究的工作。先前工作将这些标题称为“clickbaits”,且主要关注从标题本身提取的特征,这限制了性能,因为标题与新闻正文之间的一致性未被充分重视。本文中,我们清晰地重新定义了该问题,并分别识别模糊与误导性标题。在检测模糊标题时,我们利用类序列规则来挖掘结构信息。对于误导性标题的识别,我们基于标题与正文之间的一致性提取特征。为利用大规模未标注数据集,我们应用了 co-training 方法并获得了性能提升。实验结果表明了我们所提方法的有效性。随后,我们使用分类器检测从不同的来源爬取的不准确标题,并进行了数据分析。

关键词

引用

@article{arxiv.1705.06031,
  title  = {Learning to Identify Ambiguous and Misleading News Headlines},
  author = {Wei Wei and Xiaojun Wan},
  journal= {arXiv preprint arXiv:1705.06031},
  year   = {2017}
}

备注

Accepted by IJCAI 2017