统计新闻文章中的抗议活动:一个数据集与半自动化数据收集流水线
计算与语言
2021-02-02 v1
摘要
2017 年 1 月至 2021 年 1 月间,美国数以千计的地方新闻来源报道了超过 42,000 起关于民权、移民、枪支及环境等议题的抗议活动。鉴于每日报道抗议活动的地方记者数量庞大,将这些事件抽取为结构化数据以理解时间与地理趋势,可赋能公民决策。然而,从新闻文章中抽取事件这一任务在领域检测、槽填充与指代消解等领域给 NLP 社区带来了众所周知的挑战。为丰富从新闻故事中抽取结构化数据所需的资源,我们的贡献有三方面。我们 1) 发布一个手动标注的数据集,包含新闻文章 URL、日期、地点、人群规模估计,以及对应于 2017 年 1 月至 2021 年 1 月间美国 42,347 起报道抗议事件的 494 个离散描述性标签;2) 描述用于发现、排序并审阅构成该数据集的 144,568 篇英文文章的半自动化数据收集流水线;以及 3) 基准测试一个长短期记忆 (LSTM) 低维分类器,其展示了基于段落与句子等句法结构处理新闻文章以统计报道抗议事件数量的效用。
引用
@article{arxiv.2102.00917,
title = {Counting Protests in News Articles: A Dataset and Semi-Automated Data Collection Pipeline},
author = {Tommy Leung and L. Nathan Perkins},
journal= {arXiv preprint arXiv:2102.00917},
year = {2021}
}