SemCAFE:当命名实体决定差异 时评估网络源可靠性
计算与语言
2025-09-10 v2 计算机与社会
机器学习
摘要
随着传统媒体向数字媒体的转变,线上环境不仅包含可靠的新闻文章,也包含大量不可靠的内容。数字媒体因可达性更快,显著影响公众舆论并推动政治议程。虽然报纸读者可能熟悉其偏好的新闻来源的政治倾向或可信度,但确定不可靠的新闻文章则更具挑战性。许多在线来源的可信度往往是不透明的,AI 生成的内容能够以极低的成本快速扩散。不可靠的新闻文章——尤其是那些跟随 2022 年俄乌战争而产生的文章——仿冒可信来源的话题和写作风格,难以被区分。为此,我们提出 SemCAFE,一种通过纳入实体相关性来评估新闻可靠性的系统。SemCAFE 采用标准自然语言处理技术,如模板移除和分词,同时利用 YAGO 知识库进行实体级别的语义分析。通过为每篇新闻文章创建语义指纹,SemCAFE 能够评估 46,020 篇可靠文章和 3,407 篇不可靠文章中关于 2022 年俄乌战争的可信度。我们的做法比最先进的方法提高了 12% 的宏平均 F1 分数。样本数据和代码已在 GitHub 上提供。
引用
@article{arxiv.2504.08776,
title = {SemCAFE: When Named Entities make the Difference Assessing Web Source Reliability through Entity-level Analytics},
author = {Gautam Kishore Shahi and Oshani Seneviratne and Marc Spaniol},
journal= {arXiv preprint arXiv:2504.08776},
year = {2025}
}