SciLander:科学新闻版图映射
计算机与社会
2022-05-18 v1 社会与信息网络
物理与社会
摘要
COVID-19 疫情助长了社交媒体及整个网络上错误信息的传播。这种被称为“信息疫情”的现象将信息真实性和信任的挑战推向新高度,它向误导性内容中大量引入了看似科学与技术的元素。尽管已有大量关于错误信息建模和预测的研究,但针对具有内在不确定性且研究结果不断演变的极其复杂的科学主题(如 COVID-19)的覆盖,提出了许多现有工具难以轻易解决的新挑战。为了解决这些问题,我们引入了 SciLander,一种用于学习报道科学主题新闻源表示的方法。SciLander 为新闻源提取了四个异构指标:两个通用指标捕获(1)新闻源之间对新闻故事的复制,以及(2)使用相同术语表达不同含义(即术语的语义偏移);两个科学指标捕获(1)行话的使用和(2)对特定引用的立场。我们使用这些指标作为新闻源一致性的信号,采样正(相似)和负(不相似)样本对,并将它们结合在一个统一框架中,以三元组边界损失目标训练无监督新闻源嵌入。我们在一个全新的 COVID-19 数据集上评估了我们的方法,该数据集包含来自 500 个新闻源的近 100 万篇新闻文章,时间跨度为 2020 年疫情爆发以来的 18 个月。结果表明,我们模型学习到的特征在新闻真实性分类任务上优于 SOTA 基线方法。此外,聚类分析表明,学习到的表示编码了有关这些新闻源可靠性、政治倾向和党派偏见的信息。
引用
@article{arxiv.2205.07970,
title = {SciLander: Mapping the Scientific News Landscape},
author = {Maurício Gruppi and Panayiotis Smeros and Sibel Adalı and Carlos Castillo and Karl Aberer},
journal= {arXiv preprint arXiv:2205.07970},
year = {2022}
}