中文

LMBot:将图知识蒸馏至语言模型以实现无图部署的 Twitter 机器人检测

人工智能 2024-01-04 v3 计算与语言 社会与信息网络

摘要

随着恶意行为者使用日益先进且广泛的机器人散布错误信息并操纵舆论,Twitter 机器人检测已成为一项关键任务。尽管基于图的 Twitter 机器人检测方法取得了最先进的性能,我们发现其推理依赖于距离目标多跳的邻居用户,而获取邻居耗时且可能引入偏差。同时,我们发现预训练语言模型在 Twitter 机器人检测上微调后取得了有竞争力的性能,且在部署时不需要图结构。受此发现启发,我们提出一种新颖的机器人检测框架 LMBot,将图神经网络(GNNs)的知识蒸馏到语言模型(LMs)中,以实现 Twitter 机器人检测中无图部署,从而应对数据依赖的挑战。此外,LMBot 兼容基于图和无图的数据集。具体而言,我们首先将每个用户表示为文本序列并输入 LM 进行领域自适应。对于基于图的数据集,LM 的输出为 GNN 提供输入特征,使其针对机器人检测优化并将知识以迭代、互增强的方式蒸馏回 LM。借助 LM,我们可以进行无图推理,从而解决图数据依赖和采样偏差问题。对于无图结构的数据集,我们简单地用 MLP 替换 GNN,其同样展现出强劲性能。我们的实验表明 LMBot 在四个 Twitter 机器人检测基准上取得了最先进的性能。大量研究也显示,与基于图的 Twitter 机器人检测方法相比,LMBot 更鲁棒、通用且高效。

关键词

引用

@article{arxiv.2306.17408,
  title  = {LMBot: Distilling Graph Knowledge into Language Model for Graph-less Deployment in Twitter Bot Detection},
  author = {Zijian Cai and Zhaoxuan Tan and Zhenyu Lei and Zifeng Zhu and Hongrui Wang and Qinghua Zheng and Minnan Luo},
  journal= {arXiv preprint arXiv:2306.17408},
  year   = {2024}
}

备注

11 pages, 7 figures