基于网络信息的极端类别不平衡情境下的组织化虚假信息扩散检测
计算与语言
2025-02-19 v3 人工智能
社会与信息网络
摘要
检测组织化的政治宣传活动是打击社交媒体上虚假信息的关键任务。现有方法主要采用网络科学、图机器学习和自然语言处理技术来识别此类组织化行动,其最终目标是分析用户之间的关系和互动(如转发)以及帖子之间的文本相似性。尽管这些方法在识别虚假信息扩散方面有效,但面临显著挑战,尤其是训练数据集中的类别不平衡问题。为缓解此问题,近期方法通常采用数据增强或增加正样本数量,但在现实场景下往往不可行或不足。本文提出了一种新框架,通过仅使用大型语言模型 (LLM) 来识别虚假信息扩散,引入平衡检索增强生成 (Balanced RAG) 组件。该框架首先将涉及帖子(本文中为推文)的文本信息和社交网络的用户互动信息输入语言模型。随后,通过 prompt engineering 和提出的 Balanced RAG 方法,有效检测 X (Twitter) 上的有组织的虚假信息扩散活动。该框架无需对语言模型进行任何训练或微调。通过战略性地利用 prompt engineering 和 Balanced RAG 的优势,使 LLM 能够克服类别不平衡的影响,有效识别有组织的政治宣传活动。实验结果表明,通过引入本文提出的 prompt engineering 和 Balanced RAG 方法,框架在精度、召回率和 F1 分数方面显著优于传统图基方法,提升 2-3 倍。
引用
@article{arxiv.2501.11849,
title = {Network-informed Prompt Engineering against Organized Astroturf Campaigns under Extreme Class Imbalance},
author = {Nikos Kanakaris and Heng Ping and Xiongye Xiao and Nesreen K. Ahmed and Luca Luceri and Emilio Ferrara and Paul Bogdan},
journal= {arXiv preprint arXiv:2501.11849},
year = {2025}
}