差异趋势的因果解释:在哪里?为什么?
数据库
2025-12-10 v1
摘要
在数据分析过程中,我们常常对数据集中两个感兴趣组之间观察到的某些差异感到困惑。为了更好地理解观察到的差异,我们需要能够精确定位差异最显著的数据区域及其原因(即缓解或加剧差异的因素)的解释。这项任务复杂且繁琐,特别是对于大型和高维数据集,需要一个自动系统来发现差异的解释(数据区域和原因)。差异的解释不仅需要可解释性,还需要可操作性——使用户能够做出明智的、基于数据的决策。这要求解释超越表面相关性,转而捕捉因果关系。我们引入了 ExDis,这是一个用于发现两个感兴趣组之间差异的因果解释的框架。ExDis 识别差异最显著(或反转)的数据区域(子总体),并将特定因素与每个已识别数据区域内的差异因果关联。我们正式定义了 ExDis 框架和相关的优化问题,分析了其复杂性,并开发了一个高效算法来解决该问题。通过在三个真实数据集上的广泛实验,我们证明了 ExDis 生成了有意义的因果解释,优于先前方法,并能有效扩展以处理大型、高维数据集。
引用
@article{arxiv.2512.08679,
title = {Causal Explanations for Disparate Trends: Where and Why?},
author = {Tal Blau and Brit Youngmann and Anna Fariha and Yuval Moskovitch},
journal= {arXiv preprint arXiv:2512.08679},
year = {2025}
}