SATAR:一种 Twitter 账户表示自监督学习方法及其在机器人检测中的应用
社会与信息网络
2021-08-30 v4
摘要
自 2006 年上线以来,Twitter 已成为主要的社交媒体平台,而近期关于机器人账户的投诉有所增加。尽管已有大量研究努力,最先进的机器人检测方法在泛化性与适应性方面存在不足。具体而言,以往的机器人检测器仅利用一小部分用户信息,且常训练于仅涵盖少数机器人类型的数据集。因此,它们无法泛化到不同机器人共存的真实 Twitter 空间场景。此外,Twitter 中的机器人不断演化以规避检测。以往的方法虽在其语境下曾经有效,却无法适应新一代 Twitter 机器人。为应对 Twitter 机器人检测的两大挑战,我们提出 SATAR,一种 Twitter 用户的自监督表示学习框架,并将其应用于机器人检测任务。特别地,SATAR 通过联合利用特定用户的语义、属性和邻域信息实现泛化;同时,SATAR 通过在海量自监督用户上预训练并在细粒度机器人检测场景上微调来实现适应。大量实验表明,SATAR 在信息完整度与采集时间各异的不同机器人检测数据集上均优于具有竞争力的基线。SATAR 也被证明能在真实场景泛化并适应不断演化的社交媒体机器人。
引用
@article{arxiv.2106.13089,
title = {SATAR: A Self-supervised Approach to Twitter Account Representation Learning and its Application in Bot Detection},
author = {Shangbin Feng and Herun Wan and Ningnan Wang and Jundong Li and Minnan Luo},
journal= {arXiv preprint arXiv:2106.13089},
year = {2021}
}
备注
accepted at CIKM 2021