中文

用于检验模型变量显著性的广义置换框架

统计方法学 2023-10-13 v2

摘要

机器学习中的一个常见问题是确定某个变量是否对模型的预测性能有显著贡献。对于诸如基因表达数据集等遭受最糟糕维度困境的数据集——即观测数少而可能解释变量多——该问题更为严重。在此类情形下,传统的检验变量统计显著性或构建变量置信区间的方法并不适用。为解决这些问题,我们开发了一种用于检验监督模型中变量显著性的新颖置换框架。我们的置换框架具有三大主要优势。首先,它是非参数的,不依赖分布假设或渐近结果。其次,它不仅按相对重要性对模型变量排序,还检验每个变量的统计显著性。第三,它可检验模型变量间交互作用的显著性。我们将该置换框架应用于 Iris 花数据集和 RNA 表达数据中脑区的多类分类,并利用该框架展示了变量层面的统计显著性与交互作用。

关键词

引用

@article{arxiv.2105.13952,
  title  = {Generalized Permutation Framework for Testing Model Variable Significance},
  author = {Yue Wu and Ted Spaide and Kenji Nakamichi and Russell Van Gelder and Aaron Lee},
  journal= {arXiv preprint arXiv:2105.13952},
  year   = {2023}
}