中文

Rashomon 重要性分布:摆脱基于不稳定单一模型的变量重要性

机器学习 2024-04-03 v4 基因组学 机器学习

摘要

量化变量重要性对于回答遗传学、公共政策和医学等领域的高风险问题至关重要。当前方法通常为给定数据集上训练的给定模型计算变量重要性。然而,对于给定数据集,可能存在许多同样好地解释目标结果的模型;若不考量所有可能的解释,不同研究者基于相同数据可能得出许多相互冲突却同样有效的结论。此外,即便考量了给定数据集的所有可能解释,这些见解也可能无法泛化,因为并非所有好的解释在合理的数据扰动下都是稳定的。我们提出一个新的变量重要性框架,量化变量在所有优良模型集合中的重要性,并且在数据分布上稳定。我们的框架极为灵活,可与大多数现有模型类别和全局变量重要性度量集成。我们通过实验证明,在其他方法失效的复杂仿真设置中,我们的框架能恢复变量重要性排序。进一步,我们表明该框架能准确估计底层数据分布中变量的真实重要性。我们为估计量的一致性和有限样本误差率提供了理论保证。最后,我们通过一个真实案例研究展示其效用,探究哪些基因对预测 HIV 感染者的 HIV 载量重要,突出一个先前未在与 HIV 关联中研究过的重要基因。代码见 https://github.com/jdonnelly36/Rashomon_Importance_Distribution。

关键词

引用

@article{arxiv.2309.13775,
  title  = {The Rashomon Importance Distribution: Getting RID of Unstable, Single Model-based Variable Importance},
  author = {Jon Donnelly and Srikar Katta and Cynthia Rudin and Edward P. Browne},
  journal= {arXiv preprint arXiv:2309.13775},
  year   = {2024}
}

备注

Appeared in NeurIPS 2023 as a spotlight paper