使用 LLM 和语义相似性研究社交媒体上的虚假信息叙事
社会与信息网络
2025-07-29 v1 计算机与社会
新兴技术
摘要
本论文发展了一种用于检测虚假信息叙事并捕捉其特征的细粒度相似性度量的连续尺度。为此,开发了两项工具并记录了其方法论。追踪工具接受推文和目标叙事,评估每条推文与目标叙事的相似性,并将其绘制为时间线。第二个叙事综合工具聚类超过相似性阈值的推文,并生成每个聚类的主导叙事。将这两项工具组合成推文叙事分析仪表盘。追踪工具在 GLUE STS-B 基准测试上得到验证,然后使用这两项工具进行两个案例研究进行进一步实证验证。第一个案例研究以“2020 年选举被篡改”为目标叙事,分析唐纳德·特朗普于 2020 年期间的推文。第二个案例研究以“跨种族人士对社会有害”为目标叙事,分析《纽约时报》、《卫报》、《The Gateway Pundit》和《Fox News》等媒体机构的推文。总体而言,这些案例研究的实证发现表明,语义相似性可用于虚假信息的细粒度检测、追踪和特征化。本论文中开发的工具已托管并可经作者许可获得访问。HTML 友好版本请参见 https://chaytanc.github.io/projects/disinfo-research(Inman,2025)。
引用
@article{arxiv.2507.20066,
title = {Studying Disinformation Narratives on Social Media with LLMs and Semantic Similarity},
author = {Chaytan Inman},
journal= {arXiv preprint arXiv:2507.20066},
year = {2025}
}
备注
45 pages, 8 figures, 13 tables