基于多元输入样本数据量化依赖关系用于敏感性分析
统计理论
2019-04-16 v1 统计理论
摘要
我们提出一种基于最小生成树(MSTs)估计 R\'{e}nyi 熵来量化多元数据集中依赖关系的新方法。MST 的长度可用于将变量对按从强到弱依赖排序,使其成为处理依赖输入变量的敏感性分析的有用工具。它非常适用于输入分布未知且仅有输入样本可用的情形。我们引入一种基于 MST 长度量化依赖关系的估计量,并通过若干数值算例研究其性质。为降低大规模数据集上构造精确 MST 的计算成本,我们探索了计算精确 MST 近似的方法,发现 Zhong 等人(2015)最近提出的多层方法最为精确。我们将所提方法应用于基于 Ishigami 函数的人工测试用例,以及涉及北海沉积物输运的实世界测试用例。结果与已有知识和启发式理解一致,在可计算 Sobol 指数的情形下也与基于方差的 Sobol 指数分析一致。
引用
@article{arxiv.1802.01841,
title = {Quantifying dependencies for sensitivity analysis with multivariate input sample data},
author = {A. W. Eggels and D. T. Crommelin},
journal= {arXiv preprint arXiv:1802.01841},
year = {2019}
}