中文

新闻文章框法的多语言相似性数据集

计算与语言 2024-05-24 v1 计算机与社会

摘要

理解新闻文章的写作框架对于解决社会问题至关重要,因此受到传播学领域的关注。然而,由于缺乏考虑新闻内容综合细微差别的具体且统一标准的数据集,评估此类新闻框架仍然具有挑战性。为此,我们介绍了一个扩展版本的大型标记新闻文章数据集,新增了 16,687 对标记数据。通过新闻文章两两比较的方法,我们的方法摆脱了传统新闻框分析研究中手动识别框类别的工作。总体而言,我们介绍了目前最广泛的跨语言新闻文章相似性数据集,包含 26,555 对跨 10 种语言的标记新闻文章对.每条数据都根据详细说明八个新闻内容关键方面的 codebook 进行细致标注,遵循以人类为主导的人工监督框架。应用示例展示了其在揭示全球新闻覆盖中的国家社区、暴露新闻机构之间的媒体偏见以及量化与新闻创建相关因素方面的潜力。我们设想,该新闻相似性数据集将拓宽我们对媒体生态系统的理解,涉及跨国家、地点、语言及其他社会建构的新闻事件和视角的覆盖情况。从而能够催化社会科学研究和应用方法的进步,对社会产生深远影响。

关键词

引用

@article{arxiv.2405.13272,
  title  = {A Multilingual Similarity Dataset for News Article Frame},
  author = {Xi Chen and Mattia Samory and Scott Hale and David Jurgens and Przemyslaw A. Grabowicz},
  journal= {arXiv preprint arXiv:2405.13272},
  year   = {2024}
}