统计拓扑的建模与复制,以及CMB非均匀性的证据
统计方法学
2022-06-08 v1 应用统计
其他统计学
摘要
在‘大数据’(Big Data)的旗帜下,在极大规模、高维度的数据集中检测和分类结构,是我们这个时代的核心统计挑战之一。应对这一挑战的最引人入胜的方法之一是‘拓扑数据分析’(TDA, Topological Data Analysis),其主要目标之一是对数据集提供非度量但具有拓扑信息的前期分析,使后续更定量的分析成为可能。尽管TDA建立在拓扑学的坚实数学基础之上,但在应用中它面临着由于无法处理统计可靠性和稳健性问题,以及最重要的,无法以可验证的统计置信水平做出科学论断而带来的挑战。我们提出了一种用于持续图(persistence diagrams, TDA的主要诊断工具)的参数化表示、估计和复制的方法论。该方法论的威力在于,即使仅有一个持续图可供分析——大数据应用的典型情况——也可以生成复制样本以进行常规的统计假设检验。该方法论概念简单且计算实用,为持续图TDA分析提供了一种广泛有效的统计过程。我们在一个玩具示例上演示了基本思想,并在一项新颖且揭示性的CMB非均匀性分析中展示了该方法的威力。
引用
@article{arxiv.1704.08248,
title = {Modeling and replicating statistical topology, and evidence for CMB non-homogeneity},
author = {Robert J. Adler and Sarit Agami and Pratyush Pranav},
journal= {arXiv preprint arXiv:1704.08248},
year = {2022}
}