Twitter上可扩展且符合隐私规范的病毒式传播预测
社会与信息网络
2021-02-23 v2
摘要
作为数字城镇大厅的Twitter已成为全球个人与组织偏好的沟通媒介。其中一些触达数百万受众,而另一些则难以被关注。鉴于社交媒体之影响,以下问题比以往任何时候都更相关:如何建模Twitter中的注意力动态。世界各地的研究人员借助机器学习来预测最具影响力的推文与作者,在应对社交大数据的数量、速度和多样性时做出诸多妥协。本文重新审视Twitter上的内容流行度预测。我们认为,数据获取、存储和分析算法的严格对齐对于避免可扩展性、准确性与隐私合规性之间的常见权衡是必要的。我们提出了一种新框架,用于大规模数据集的快速获取、高精度监督信号和多语言情感预测,同时尊重每一项适用的隐私请求。随后我们应用一种新颖的梯度提升框架,在病毒式传播排序中取得最先进(SOTA)结果,且尚未纳入推文的视觉或传播特征。我们的梯度提升回归树(Gradient Boosted Regression Tree)首个在基准数据集上提供可解释的强排序性能。由于分析聚焦于早期可用特征,该模型可立即应用于18种语言的 incoming 推文。
引用
@article{arxiv.1812.06034,
title = {Scalable Privacy-Compliant Virality Prediction on Twitter},
author = {Damian Konrad Kowalczyk and Jan Larsen},
journal= {arXiv preprint arXiv:1812.06034},
year = {2021}
}
备注
AffCon@AAAI-19 Best Paper Award; Presented at AAAI-19 W1: Affective Content Analysis