通过数据选择实现可扩展且可泛化的社交机器人检测
计算机与社会
2020-06-05 v1 机器学习
社会与信息网络
摘要
高效可靠的社交机器人分类对于检测社交媒体上的信息操纵至关重要。尽管发展迅速,最先进的机器人检测模型仍面临泛化与可扩展性挑战,极大限制了其应用。本文提出一种仅使用最少账户元数据的框架,可实现高效分析并扩展至实时处理Twitter全部公开推文流。为确保模型准确性,我们构建了丰富的标注数据集用于训练与验证。我们部署了严格的验证系统,使模型在未见数据集上的性能也得到优化,此外还有传统的交叉验证。我们发现,与在所有可用数据上穷尽训练相比,策略性地选择训练数据的子集可带来更好的模型准确性与泛化能力。得益于所提模型的简洁性,其逻辑可被解释从而提供对社交机器人特征的洞察。
引用
@article{arxiv.1911.09179,
title = {Scalable and Generalizable Social Bot Detection through Data Selection},
author = {Kai-Cheng Yang and Onur Varol and Pik-Mai Hui and Filippo Menczer},
journal= {arXiv preprint arXiv:1911.09179},
year = {2020}
}
备注
AAAI 2020