中文

Twitter 上自动化账号的词法分析

社会与信息网络 2018-12-20 v1

摘要

近年来,社交机器人(social bots)使用的策略日益复杂,给检测带来了挑战。尽管已提出许多方法和特征,社交机器人仍能规避检测并像人类一样互动,使得真实人类账号与机器人账号难以区分。检测系统已利用了账户资料、推文内容、网络和时间模式等大类下的各种特征。推文内容特征的使用仅限于对 URL、标签、命名实体和情感等基本术语的分析。给定一组无明显模式的推文内容,我们能否区分社交机器人与人类生成的内容?我们旨在通过利用不同数据集的大型集合分析各账号所发推文的词汇丰富度来回答这一问题。我们的结果显示,两类在词汇多样性、词汇复杂度和表情符号分布方面存在明显界限。我们发现所提出的词汇特征显著提升了两类账号的分类性能。这些特征可用于训练标准机器学习分类器以有效检测社交机器人账号。我们公开了一个新数据集以供进一步探索。

关键词

引用

@article{arxiv.1812.07947,
  title  = {Lexical analysis of automated accounts on Twitter},
  author = {Isa Inuwa-Dutse and Bello Shehu Bello and Ioannis Korkontzelos},
  journal= {arXiv preprint arXiv:1812.07947},
  year   = {2018}
}

备注

8 pages, 4 figures, 4 tables, IADIS International Conference WWW/Internet 2018