跨语料库线索生成中“新闻价值”的建模
计算与语言
2021-04-21 v1 信息检索
摘要
记者通过阅读大量政府记录语料库(如法院案件、提案法案等)获取“线索”或故事创意。然而,此类记录中仅有很小比例是有趣文档。我们提出了一个旨在浮现有趣文档的“新闻价值”模型。我们在自动标注的语料库——已发表的新闻报纸文章——上训练模型,以预测每篇文章是否为头版文章(即 \textbf{newsworthy})或非头版文章(即 \textbf{less newsworthy})。我们将这些模型迁移至未标注的语料库——法院案件、法案、市议会会议记录——以对这些语料库中的文档按“新闻价值”排序。一个微调的 RoBERTa 模型在留出标注文档上取得了 .93 的 AUC 性能,在专家验证的未标注语料库上取得了 .88 的 AUC。我们提供了对模型的解读与可视化。
引用
@article{arxiv.2104.09653,
title = {Modeling "Newsworthiness" for Lead-Generation Across Corpora},
author = {Alexander Spangher and Nanyun Peng and Jonathan May and Emilio Ferrara},
journal= {arXiv preprint arXiv:2104.09653},
year = {2021}
}