中文

捕捉野风:在大规模新闻语料库中检测媒体风暴

计算与语言 2025-03-05 v2

摘要

媒体风暴,即对某个故事注意力的戏剧性爆发,是媒体动态和注意力格局的核心组成部分。尽管意义重大,但由于测量和操作化的问题,对这一概念的系统性和实证研究很少。我们引入了一种迭代的人机交互方法,用于在大规模新闻文章语料库中识别媒体风暴。首先根据几个文本特征将文本转换为离散信号。在每次迭代中,我们对这些信号应用无监督异常检测;然后由专家验证每个异常以确认风暴的存在,然后使用这些结果来调整下一次迭代的异常检测。我们在两种场景中展示了该方法的适用性:首先,补充特定时间范围内的初始媒体风暴列表;其次,检测新时间段内的媒体风暴。我们提供了一个使用这两种场景编译的媒体风暴数据集。该方法和数据集都为对媒体风暴概念进行全面实证研究提供了基础,包括表征它们以及预测它们的爆发和持续时间,无论是在主流媒体还是社交媒体平台上。

关键词

引用

@article{arxiv.2404.09299,
  title  = {Reap the Wild Wind: Detecting Media Storms in Large-Scale News Corpora},
  author = {Dror K. Markus and Effi Levi and Tamir Sheafer and Shaul R. Shenhav},
  journal= {arXiv preprint arXiv:2404.09299},
  year   = {2025}
}

备注

This paper was accepted and published in Findings of EMNLP 2024. The final version is available at: https://aclanthology.org/2024.findings-emnlp.275/