中文

追踪公共文档的新闻价值

计算与语言 2023-11-17 v1

摘要

记者必须在海量文本数据(如泄密文件、法案、新闻稿)中寻找报道线索,这是其工作的一部分:确定文本何时以及为何成为新闻,有助于我们理解报道模式并构建辅助工具。然而这颇具挑战,因为标注的关联数据极少、不同语料间的语言使用差异巨大,且文本可能因多种原因被报道。本文关注《旧金山纪事报》对旧金山湾区地方公共政策的报道。首先,我们收集新闻文章、公共政策文档和会议录音,并利用概率关系建模将它们关联起来,结果表明这是一种低标注量的关联方法,优于其他基于检索的基线。其次,我们定义了一项新任务:新闻价值预测,用于预测某项政策条目是否会被报道。我们展示了公共政策讨论的不同方面会产生不同的新闻价值信号。最后,我们与资深记者进行了人工评估,结果表明我们的系统以 68% 的 F1 值识别出他们认为有新闻价值的政策,且我们的报道推荐以 84% 的胜率被证明是有帮助的。

关键词

引用

@article{arxiv.2311.09734,
  title  = {Tracking the Newsworthiness of Public Documents},
  author = {Alexander Spangher and Emilio Ferrara and Ben Welsh and Nanyun Peng and Serdar Tumgoren and Jonathan May},
  journal= {arXiv preprint arXiv:2311.09734},
  year   = {2023}
}

备注

9 pages, 7 pages appendix