层次聚类:观测性因果推断中多重共线性问题的新解法
统计方法学
2026-06-30 v1 机器学习
应用统计
摘要
多重共线性是观测性因果推断中长期存在的挑战,尤其是在回归分析中——高度相关的自变量使得难以分离它们对目标结果的各自影响。虽然诸如收缩估计量和主成分回归等常见解决方案在预测问题中有所帮助,但一个关键限制阻碍了它们在因果推断问题中的适用性——它们无法提供原始的因果关系。为填补这一空白,我们提出了一种创新且直观的解决方案,通过采用层次聚类来聚合数据,从而有效缓解共线性。该方法普遍适用于具有多重共线性特征的因果问题。我们使用一个营销应用来演示其工作原理及原因。不同广告渠道的支出通常表现出相关性,使得分别衡量其影响变得极其困难。许多先前的研究提出利用细粒度横截面数据来改进识别,但据我们所知,没有一项研究明确解决多重共线性问题,而即使使用细粒度数据,多重共线性也会削弱因果识别。我们建议基于营销支出相关性对地理单元进行层次聚类以减少共线性,并使用聚类级数据实施贝叶斯营销组合模型。这种聚类分两步进行——我们首先对地理级数据进行归一化和去均值化,以建立共同尺度并消除共同趋势;然后计算成对距离以总结地理单元间的营销支出相关性,并对具有中度至强相关性的单元进行聚类。描述性证据和回归分析均证实,这种层次聚类有效缓解了共线性,并有助于分别识别不同营销渠道的影响。
引用
@article{arxiv.2606.30992,
title = {Hierarchical Clustering As a Novel Solution to the Notorious Multicollinearity Problem in Observational Causal Inference},
author = {Yufei Wu and Zhiying Gu and Alex Deng and Jacob Zhu and Linsha Chen},
journal= {arXiv preprint arXiv:2606.30992},
year = {2026}
}
备注
Presented at the KDD 2023 Workshop on Causal Inference and Machine Learning in Practice, Long Beach, CA; also presented at the 2023 Joint Statistical Meetings