利用辛普森悖论发现行为数据中的有趣模式
计算机与社会
2018-05-09 v1 人工智能
数据分析、统计与概率
摘要
我们描述了一种利用辛普森悖论来揭示行为数据中有趣模式的数据驱动发现方法。我们的方法系统地分解数据,以识别群体中行为显著偏离其余部分子群体。给定感兴趣的结果和一组协变量,该方法遵循三个步骤。首先,通过以特定协变量为条件将数据分解为子群体,以最小化子群体内部结果的变异。接下来,将结果建模为另一协变量的线性函数,分别在子群体和聚合数据中进行。最后,比较趋势以识别产生与聚合数据行为不同的子群体的分解方式。我们通过将该应用于三个真实世界行为数据集来阐明该方法,包括问答网站 Stack Exchange 以及在线学习平台 Khan Academy 和 Duolingo。
引用
@article{arxiv.1805.03094,
title = {Using Simpson's Paradox to Discover Interesting Patterns in Behavioral Data},
author = {Nazanin Alipourfard and Peter G. Fennell and Kristina Lerman},
journal= {arXiv preprint arXiv:1805.03094},
year = {2018}
}
备注
Proceedings of the 12th International Conference on Web and Social Media