中文

推断交互式数据分析

统计理论 2017-07-24 v1 统计理论

摘要

我们描述了推断交互式数据分析(inferactive data analysis),如此命名是为了表示一种强调数据分析后进行推断的交互式数据分析方法。我们的方法是 Tukey 的探索性(粗略地说“无模型”)与验证性数据分析(粗略地说经典且“基于模型”)之间的折中,同时也允许进行贝叶斯数据分析。我们将这种方法视为在精神上与应用统计学家和数据科学家的当前实践相近,同时允许在科学文献中报告频率学派保证的结果,或者允许数据科学家在进行一些初步探索性分析后选择统计模型(从而选择先验)的贝叶斯结果。虽然这种数据分析方法并不涵盖所有场景以及数据科学家可能使用的每一种算法,但我们将其视为为当前数据科学家具体提供工具(带有频率学派统计保证)的有用一步。我们使用的推断基础是选择性推断 [Lee et al., 2016, Fithian et al., 2014],特别是其随机化形式 [Tian and Taylor, 2015a]。随机化框架除了提供额外的功效和更短的置信区间外,还通过 Tian et al. [2016] 的 {\em selective sampler} 提供了相关参考分布的显式形式(至多差一个归一化常数)。这些参考分布是由我们称之为 DAG-DAG——即数据分析生成 DAG——所形成的特定条件分布构建的。由于在 DAG 中对条件分布进行抽样通常很复杂,因此选择性采样器对于推断交互式数据分析的任何实际实现都至关重要。我们的主要目标是回顾选择性推断的最新进展,并描述选择性推断的一般哲学。

关键词

引用

@article{arxiv.1707.06692,
  title  = {Inferactive data analysis},
  author = {Nan Bi and Jelena Markovic and Lucy Xia and Jonathan Taylor},
  journal= {arXiv preprint arXiv:1707.06692},
  year   = {2017}
}

备注

43 pages