通过随机森林识别 Twitter 用户国籍的方法论提案
社会与信息网络
2023-01-20 v1
摘要
我们披露一种方法论,以确定社交网络中具有局部关系(例如国籍)的讨论参与者及其贡献,并在过程中提供特定水平的信任与效率。该动态是一项已需求研究及近期解决方案若干近似的挑战。本研究解决了在意见请求(具有政治性质与社会参与)前识别 Twitter 社交网络用户国籍的问题。所采用的方法通过机器学习对 Twitter 用户国籍进行分类,以在三个中美洲国家开展意见研究。使用 Random Forests 算法基于用户间不同交互发生次数 exclusively 数值特征,利用小训练样本生成分类模型。在对初始数据中各国国民比例推断所达比例取平均时,计算出平均 77.40%,相较应用自动分类模型后的平均 91.60%,平均提升 14.20%。总之,可见所建议的方法集在面临意见问题时提供了合理的方法与效率。
引用
@article{arxiv.2211.08370,
title = {Methodological proposal to identify the nationality of Twitter users through Random-Forests},
author = {Damián Quijano and Richard Gil-Herrera},
journal= {arXiv preprint arXiv:2211.08370},
year = {2023}
}
备注
31 pages, 10 figures, 4 tables