利用 Transformer 在 X (Twitter) 上进行机器人多模态检测
计算与语言
2024-07-31 v2
摘要
尽管并非所有机器人都是恶意的,但绝大多数负责传播虚假信息并操纵关于若干议题(如选举等)的公众舆论。因此,尽早检测机器人至关重要。尽管已有针对社交媒体中机器人的检测方法提出,仍存在显著局限。例如,现有研究计划仍提取大量特征并训练传统机器学习算法,或使用 GloVe 嵌入并训练 LSTM。然而,特征提取是繁琐过程且需领域专长。此外,基于 transformer 的语言模型已被证明优于 LSTM。其他方法构建大型图并训练图神经网络,因而需大量训练时间并依赖计算资源。为应对这些局限,本研究首次仅使用用户描述字段与表示用户所发推文类型及内容的三个通道图像。首先,我们创建数字 DNA 序列,将其转换为三维图像,并应用视觉领域预训练模型,包括 EfficientNet、AlexNet、VGG16 等。接着,我们提出一种多模态方法,使用 TwHIN-BERT 获取用户描述字段的文本表示,并采用 VGG16 获取图像模态的视觉表示。我们提出三种融合方法,即拼接、门控多模态单元与跨模态注意力,以融合不同模态并比较其性能。最后,我们对性能最佳模型的行为进行定性分析。在 Cresci'17 与 TwiBot-20 数据集上的大量实验表明,我们所引入方法相较最先进方法具有显著优势。
引用
@article{arxiv.2308.14484,
title = {Multimodal Detection of Bots on X (Twitter) using Transformers},
author = {Loukas Ilias and Ioannis Michail Kazelidis and Dimitris Askounis},
journal= {arXiv preprint arXiv:2308.14484},
year = {2024}
}
备注
IEEE Transactions on Information Forensics and Security (Accepted)