用于可解释数据驱动发现与预测的交集之并(UoI)方法
机器学习
2017-11-03 v2
摘要
科学数据日益增长的规模和复杂性可以极大地促进基础科学应用的发现与预测。然而,实现这一潜力需要既具有可解释性又具有预测能力的新型统计分析方法。我们引入了交集之并(Union of Intersections, UoI),一个灵活、模块化且可扩展的框架,用于增强模型选择与估计。基于 UoI 的方法分别通过交集和并集操作进行模型选择和模型估计。我们证明,基于 UoI 的方法能够对少量可解释特征实现低方差且近乎无偏的估计,同时保持高质量的预测精度。我们进行了广泛的数值研究,在合成数据和真实数据上评估了一种 UoI 算法()。在此过程中,我们展示了从人类电生理记录中提取可解释的功能网络,以及利用精简特征从基因型-表型数据中准确预测表型。我们还展示了(通过该基础框架的 和 变体)在多个基准生物医学数据集上,分类和矩阵分解的预测简约性得到改善。这些结果表明,基于 UoI 框架的方法可以改善跨科学领域数据驱动发现中的解释与预测。
引用
@article{arxiv.1705.07585,
title = {Union of Intersections (UoI) for Interpretable Data Driven Discovery and Prediction},
author = {Kristofer E. Bouchard and Alejandro F. Bujan and Farbod Roosta-Khorasani and Shashanka Ubaru and Prabhat and Antoine M. Snijders and Jian-Hua Mao and Edward F. Chang and Michael W. Mahoney and Sharmodeep Bhattacharyya},
journal= {arXiv preprint arXiv:1705.07585},
year = {2017}
}
备注
42 pages; a conference version is in NIPS 2017