利用基于大语言模型的概念提取与 FakeCTI 数据集提升针对虚假信息活动的网络威胁情报
密码学与安全
2025-10-20 v2
摘要
假新闻和虚假信息活动的迅速传播对公众信任、政治稳定和网络安全构成了重大威胁。传统的网络威胁情报(CTI)方法依赖于域名和社交媒体账号等低级指标,这些指标很容易被频繁修改其在线基础设施的对手规避。为解决这些局限性,我们引入了一个新颖的 CTI 框架,该框架侧重于从虚假信息活动的重复叙事和关系中提取的高级语义指标。我们的方法从非结构化的虚假信息内容中提取结构化的 CTI 指标,利用大语言模型(LLM)捕获假新闻中的关键实体及其上下文依赖关系。我们进一步引入了 FakeCTI,这是首个将假新闻与虚假信息活动和威胁行为者系统关联起来的数据集。为评估我们 CTI 框架的有效性,我们分析了多种假新闻归因技术,涵盖从传统自然语言处理(NLP)到微调的大语言模型。这项工作将焦点从低级工件转移到持久的概念结构,建立了一种可扩展且自适应的跟踪和对抗虚假信息活动的方法。
引用
@article{arxiv.2505.03345,
title = {Elevating Cyber Threat Intelligence against Disinformation Campaigns with LLM-based Concept Extraction and the FakeCTI Dataset},
author = {Domenico Cotroneo and Roberto Natella and Vittorio Orbinato},
journal= {arXiv preprint arXiv:2505.03345},
year = {2025}
}
备注
Accepted for publication in the Journal of Systems and Software (Special Issue on Reliable and Secure Large Language Models for Software Engineering)