中文

用于机器账号检测的深层神经网络

人工智能 2018-09-27 v2 社会与信息网络

摘要

检测机器账号(由软件控制但伪装成人类用户的自动化社交媒体账户)这一问题具有重大影响。例如,机器账号曾被用来通过扭曲在线话语来左右政治选举、操纵股票市场,或推动导致健康流行病的反疫苗阴谋论。迄今为止提出的大多数技术都在账户级别检测机器账号,通过处理大量社交媒体帖子,并利用网络结构、时间动态、情感分析等信息。在本文中,我们提出了一种基于上下文长短期记忆(LSTM)架构的深层神经网络,它利用内容和元数据在推文级别检测机器账号:从用户元数据中提取上下文特征,并作为处理推文文本的 LSTM 深层网络的辅助输入。我们做出的另一贡献是提出一种基于合成少数类过采样的技术,以从极少量的标注数据(约 3,000 个复杂 Twitter 机器账号样本)生成适用于深层网络训练的大型标注数据集。我们证明,仅从单条推文,我们的架构就能在区分机器账号与人类时实现高分类准确率(AUC > 96%)。我们将同一架构应用于账户级机器账号检测,实现了近乎完美的分类准确率(AUC > 99%)。我们的系统在利用小而可解释的特征集的同时,仅需极少的训练数据,便优于先前的最先进水平。

关键词

引用

@article{arxiv.1802.04289,
  title  = {Deep Neural Networks for Bot Detection},
  author = {Sneha Kudugunta and Emilio Ferrara},
  journal= {arXiv preprint arXiv:1802.04289},
  year   = {2018}
}