中文

自动生成推文的即时检测

社会与信息网络 2018-02-06 v1

摘要

大多数先前与推文分类相关的工作集中于将给定推文识别为垃圾信息,或将Twitter用户账户分类为垃圾发送者或机器人。多数情况下推文分类是离线进行的,基于预先收集的推文数据集。本文中我们提出一种\emph{即时}方法,将每条新下载的推文分类为\emph{自动生成}或非自动生成。我们将自动生成推文(AGT)定义为全部或部分的自然语言内容由机器人或其他类型程序自动生成的推文。我们的即时方法使用两个分类器。第一个仅基于推特文本和每条推文附带的推文元数据对推文分类,用于无可用推文历史的未知用户所发推文。未知用户也会触发批处理作业开始下载缺失的用户时间线信息。第二个分类器用于已下载并可用用户时间线的用户所发推文。最初,将由第一个分类器处理大部分推文。这将逐渐改变,在下载最活跃用户历史数据的初始化阶段后,我们达到这样一种状态:第二个分类器处理绝大多数推文。使用我们即时检测机制的模拟表明,我们可处理每天多达68,000名唯一用户的Twitter流。瓶颈是下载新用户时间线所需的时间。AGT检测非常准确。在5,000条推文集合中,通过按主题交叉验证,我们正确分类了约98%的所有AGT。

关键词

引用

@article{arxiv.1802.01197,
  title  = {On-the-fly Detection of Autogenerated Tweets},
  author = {Jonas Lundberg and Jonas Nordqvist and Antonio Matosevic},
  journal= {arXiv preprint arXiv:1802.01197},
  year   = {2018}
}

备注

17 pages