中文

网络大时间序列数据中因果路径的计数

社会与信息网络 2022-02-10 v1 数据结构与算法 物理与社会

摘要

图或网络表示是关系数据中数据挖掘和机器学习任务的重要基础。许多网络分析工具,如中心性度量、信息排序或簇检测,都基于这样的假设:连边捕捉直接影响,而路径代表可能的间接影响。在时间戳网络数据(例如动态社交网络、生物序列或金融交易)中,这一假设不成立。在此类数据中,对于两个时间戳连边 (A,B) 和 (B,C),时间先后顺序与时间间隔决定了是否存在从节点 A 经 B 到 C 的因果路径。若干工作表明,正因如此,网络分析不能直接应用于时间戳网络数据。解决此问题的现有方法需要因果路径上的统计量,这对于大数据集在计算上具有挑战性。针对该问题,我们开发了一种在时间戳网络数据中计数因果路径的高效算法。将其应用于经验数据,我们表明该方法比某开源数据分析包中实现的基线方法更高效。我们的方法对于因果路径连续连边间最大时间差的不同取值均高效,并支持流式场景。借此,我们填补了阻碍复杂网络大时间序列数据高效分析的空白。

关键词

引用

@article{arxiv.1905.11287,
  title  = {Counting Causal Paths in Big Times Series Data on Networks},
  author = {Luka V. Petrovic and Ingo Scholtes},
  journal= {arXiv preprint arXiv:1905.11287},
  year   = {2022}
}

备注

10 pages, 2 figures