用语义匹配释义建模科学传播中的信息变化
计算与语言
2022-10-25 v1 计算机与社会
机器学习
摘要
媒体是否忠实地传播科学信息长期以来是科学界的核心问题。自动识别释义的科学发现可实现科学传播过程中信息变化的大规模追踪与分析,但这要求系统理解跨多个领域的科学信息之间的相似性。为此,我们提出 SCIENTIFIC PARAPHRASE AND INFORMATION CHANGE DATASET(SPICED),首个标注信息变化程度的科学发现释义数据集。SPICED 包含从新闻报道、社交媒体讨论与原始论文全文中提取的 6000 对科学发现。我们证明 SPICED 提出了一项具有挑战性的任务,且在 SPICED 上训练的模型提升了针对真实世界科学声明事实核查的证据检索下游性能。最后,我们表明在 SPICED 上训练的模型能揭示人们与组织忠实传播新科学发现的程度方面的大规模趋势。数据、代码与预训练模型可在 http://www.copenlu.com/publication/2022_emnlp_wright/ 获取。
引用
@article{arxiv.2210.13001,
title = {Modeling Information Change in Science Communication with Semantically Matched Paraphrases},
author = {Dustin Wright and Jiaxin Pei and David Jurgens and Isabelle Augenstein},
journal= {arXiv preprint arXiv:2210.13001},
year = {2022}
}
备注
In EMNLP 2022; 25 pages; 11 figures; 6 tables