网络大时间序列数据中因果路径的计数
社会与信息网络
2022-02-10 v1 数据结构与算法
物理与社会
摘要
图或网络表示是关系数据中数据挖掘和机器学习任务的重要基础。许多网络分析工具,如中心性度量、信息排序或簇检测,都基于这样的假设:连边捕捉直接影响,而路径代表可能的间接影响。在时间戳网络数据(例如动态社交网络、生物序列或金融交易)中,这一假设不成立。在此类数据中,对于两个时间戳连边 (A,B) 和 (B,C),时间先后顺序与时间间隔决定了是否存在从节点 A 经 B 到 C 的因果路径。若干工作表明,正因如此,网络分析不能直接应用于时间戳网络数据。解决此问题的现有方法需要因果路径上的统计量,这对于大数据集在计算上具有挑战性。针对该问题,我们开发了一种在时间戳网络数据中计数因果路径的高效算法。将其应用于经验数据,我们表明该方法比某开源数据分析包中实现的基线方法更高效。我们的方法对于因果路径连续连边间最大时间差的不同取值均高效,并支持流式场景。借此,我们填补了阻碍复杂网络大时间序列数据高效分析的空白。
引用
@article{arxiv.1905.11287,
title = {Counting Causal Paths in Big Times Series Data on Networks},
author = {Luka V. Petrovic and Ingo Scholtes},
journal= {arXiv preprint arXiv:1905.11287},
year = {2022}
}
备注
10 pages, 2 figures