社交影响的概率因果分析
社会与信息网络
2018-08-31 v2 机器学习
物理与社会
机器学习
摘要
掌握社交影响的动态需要在信息传播的轨迹数据库中,将真正的因果过程与 temporal 相关性(即同质性及其他伪原因)分离开来。然而,大多数刻画社交影响的研究,以及一般而言大多数数据科学分析,聚焦于相关性、统计独立或条件独立。直到最近,对“因果数据科学”(例如基于因果性理论)的兴趣才重新兴起。本文中,我们采用一种有原则的因果方法来分析来自信息扩散数据的社交影响,其根植于概率因果理论。我们的方法包含两个阶段。在第一阶段,为避免当数据跨越多种子类型混合(“辛普森悖论”)时误解因果的陷阱,我们将传播轨迹集合划分为若干组,使得每组在信息传播的层级结构上尽可能少矛盾。为实现该目标,我们借鉴“痛苦(agony)”概念并定义痛苦有界划分问题,证明其为难解问题,并为之开发了两种具有近似保证的高效算法。在第二阶段,对第一阶段得到的每组,我们应用约束 MLE 方法来最终学习一个最小因果拓扑。合成数据上的实验表明,我们的方法能够相对于真实生成模型检索出真正的因果弧。真实数据上的实验表明,通过仅聚焦于提取的因果结构而非整个社交图,预测影响扩散的有效性得到显著提升。
引用
@article{arxiv.1808.02129,
title = {Probabilistic Causal Analysis of Social Influence},
author = {Francesco Bonchi and Francesco Gullo and Bud Mishra and Daniele Ramazzotti},
journal= {arXiv preprint arXiv:1808.02129},
year = {2018}
}