SINCon:缓解基于 Transformer 的 LLM 生成恶意消息注入攻击以检测谣言
密码学与安全
2025-04-11 v1
摘要
在大语言模型 (LLM) 快速演化的时代,基于消息传播树 (MPT) 的最先进谣言检测系统——该系统将帖子作为其根,回复作为其后代——正面临来自利用 LLM 生成并注入恶意消息的对抗攻击的日益增加的威胁。现有方法基于假设不同节点在预测中具有不同程度的影响的假设。它们将预测影响力高的节点定义为重要节点并针对其进行攻击。如果模型将节点预测影响力处理得更为均匀,攻击者将更难针对高预测影响力的节点。在本文中,我们提出了一种名为 Similarizing the predictive Influence of Nodes with Contrastive Learning (SINCon) 的防御机制,该机制鼓励模型学习图表示,其中具有不同重要性的节点对预测的影响更加均匀。针对 Twitter 和 Weibo 数据集进行的广泛实验表明,SINCon 不仅在干净数据上保持高的分类准确率,而且显著增强了对 LLM 生成的消息注入攻击的抵抗力。
引用
@article{arxiv.2504.07135,
title = {SINCon: Mitigate LLM-Generated Malicious Message Injection Attack for Rumor Detection},
author = {Mingqing Zhang and Qiang Liu and Xiang Tao and Shu Wu and Liang Wang},
journal= {arXiv preprint arXiv:2504.07135},
year = {2025}
}