社交平台的 Lead-Lag 预测基准数据集
机器学习
2025-11-07 v1
摘要
社交和协作平台产生包含早期交互(如浏览、点赞或下载)随后在数月乃至数年后跟随高影响力活动(如引用、销售或评论)的多变量时间序列痕迹。我们将此设定形式化为 Lead-Lag 预测 (LLF):给定早期使用频道(lead),预测相关但时间偏移的结果频道(lag)。尽管此类模式广泛存在,LLF 尚未被时间序列社区作为统一的预测问题来对待,主要due缺乏标准化数据集。为锚定 LLF 研究,本文提出两个高规模基准数据集——arXiv(访问 -> 230 万篇论文的引用)和 GitHub(推送/星标 -> 300 万仓库的 fork),并概述其他具有类似 lead-lag 动态的领域,包括 Wikipedia(页面浏览 -> 编辑)、Spotify(流媒体 -> 演唱会出席)、电子商务(点击 -> 购买)以及 LinkedIn 个人资料(浏览 -> 消息)。这些数据集为 lead-lag 预测提供了理想的测试平台,捕捉跨越数年的长期动态,覆盖结果的全部范围,并避免样本存活偏差。我们详细记录了数据清洗和策源的全部技术细节,通过统计和分类测试验证了 lead-lag 动态的存在,并对参数和非参数基线进行回归基准测试。我们的研究确立了 LLF 作为一种新型预测范式,为其在社交和使用数据中的系统性探索奠定了实证基础。我们的数据门户提供下载和文档,地址为 https://lead-lag-forecasting.github.io/。
引用
@article{arxiv.2511.03877,
title = {Benchmark Datasets for Lead-Lag Forecasting on Social Platforms},
author = {Kimia Kazemian and Zhenzhen Liu and Yangfanyu Yang and Katie Z Luo and Shuhan Gu and Audrey Du and Xinyu Yang and Jack Jansons and Kilian Q Weinberger and John Thickstun and Yian Yin and Sarah Dean},
journal= {arXiv preprint arXiv:2511.03877},
year = {2025}
}