基于图学习的工具变量检测:以悉尼高维 GIS-人口普查数据房价应用为例
机器学习
2020-12-17 v2 机器学习
应用统计
摘要
内生性偏差与工具变量验证一直是统计学与计量经济学中的重要课题。在大数据时代,此类问题通常与维度问题相结合,因此需要更多关注。在本文中,我们融合机器学习与生物统计中两种广为人知的工具——变量选择算法与概率图——利用 2010 年悉尼数据估计房价及相应的因果结构。估计使用了一个 200 千兆字节的超高维数据库,包含本地学校数据、GIS 信息、人口普查数据、房屋特征及其他社会经济记录。利用“大数据”,我们展示了可高效执行数据驱动的工具选择并剔除无效工具。我们的方法在高维、复杂因果结构及由此产生的多重共线性下,提升了变量选择的稀疏性、稳定性与鲁棒性,并恢复出稀疏且直观的因果结构。该方法在内生性检测、工具验证、弱工具剪枝与有效工具选择上也展现出效率与效果。从机器学习视角看,估计结果既符合又确认了悉尼房地产市场的事实、经典经济理论以及先前联立方程建模的发现。此外,估计结果与传统计量工具(如两阶段最小二乘回归与不同工具检验)一致并受其支持。所有代码见 \url{https://github.com/isaac2math/solar_graph_learning}。
引用
@article{arxiv.2007.15769,
title = {Instrument variable detection with graph learning : an application to high dimensional GIS-census data for house pricing},
author = {Ning Xu and Timothy C. G. Fisher and Jian Hong},
journal= {arXiv preprint arXiv:2007.15769},
year = {2020}
}
备注
introduction rewritten; detailed graph learning and variable selection procedure explained