TwiBot-20:一个全面的 Twitter 机器人检测基准
社会与信息网络
2021-08-30 v4
摘要
Twitter 已成为重要的社交媒体平台,同时存在大量恶意 Twitter 机器人并引发不良社会影响。成功的 Twitter 机器人检测方案通常为有监督式,严重依赖大规模数据集。然而,现有基准普遍存在用户多样性低、用户信息有限和数据稀缺的问题。因此,这些数据集不足以训练和稳定地基准测试机器人检测方法。为缓解这些问题,我们提出 TwiBot-20,一个大规模的 Twitter 机器人检测基准,包含 229,573 个用户、33,488,192 条推文、8,723,736 项用户属性以及 455,958 条关注关系。TwiBot-20 涵盖多样化的机器人与真实用户,以更好地代表真实世界的 Twitter 空间。TwiBot-20 还包含三种模态的用户信息,以支持单用户的二分类和社区感知方法。据我们所知,TwiBot-20 是迄今最大的 Twitter 机器人检测基准。我们复现了具有竞争力的机器人检测方法,并在 TwiBot-20 和另外两个公开数据集上进行了全面评估。实验结果表明,现有机器人检测手段在 TwiBot-20 上未能达到其先前宣称的性能,这说明 Twitter 机器人检测仍是一项具有挑战性的任务,需要进一步的科研努力。
引用
@article{arxiv.2106.13088,
title = {TwiBot-20: A Comprehensive Twitter Bot Detection Benchmark},
author = {Shangbin Feng and Herun Wan and Ningnan Wang and Jundong Li and Minnan Luo},
journal= {arXiv preprint arXiv:2106.13088},
year = {2021}
}
备注
accepted at CIKM 2021