基于上下文的推文互动预测
信息检索
2023-10-06 v1 机器学习
社会与信息网络
摘要
Twitter 目前是最大的社交媒体平台之一。其用户可分享、阅读并互动于称为推文的短帖。为 2020 年 ACM 推荐系统会议,Twitter 发布了约 70 GB 的年度 RecSys Challenge 数据集。2020 年 RecSys Challenge 邀请参赛团队构建模型,预测给定用户-推文组合的互动可能性。预测 like、reply、retweet 与 quote 互动的提交模型基于两项指标评估:精确率-召回率曲线下面积(PRAUC)与相对交叉熵(RCE)。在本毕业论文中,我们使用 RecSys 2020 Challenge 数据集与评估流程,探究仅依靠上下文预测推文互动可能性的效果。为此,我们在 TU Wien 的 Little Big Data Cluster 上使用 Spark 引擎构建可扩展的数据预处理、特征工程、特征选择与机器学习流水线。我们手动创建了不到 200 个额外特征以描述推文上下文。结果表明,描述用户历史互动行为及推文中标签与链接流行度的特征最具信息量。我们还发现预测算法、训练数据集规模、训练数据集采样方法与特征选择等因素显著影响结果。在将仅上下文预测模型的最佳结果与仅内容模型及 Challenge 优胜模型比较后,我们发现基于上下文的模型在 RCE 分数上表现欠佳。本工作最后对该差异进行定位,并提出对我们公开于 git 仓库的实现的潜在改进。
引用
@article{arxiv.2310.03147,
title = {Context-Based Tweet Engagement Prediction},
author = {Jovan Jeromela},
journal= {arXiv preprint arXiv:2310.03147},
year = {2023}
}
备注
Submitted as a Diploma Thesis at TU Wien on 2023-05-25. Advisor: Peter Knees. 198 pages