利用多数据因果发现为机器学习应用选择鲁棒特征
机器学习
2023-07-03 v5 机器学习
大气与海洋物理
计算物理
摘要
鲁棒特征选择对于创建可靠且可解释的机器学习(ML)模型至关重要。在领域知识有限且底层交互未知的情况下设计统计预测模型时,选择最优特征集通常很困难。为缓解此问题,我们引入一种多数据(M)因果特征选择方法,其同时处理时间序列数据集的集成并产出一组因果驱动因子。该方法使用Tigramite Python包中实现的因果发现算法PC1或PCMCI。这些算法利用条件独立性检验推断因果图的部分结构。我们的因果特征选择方法在将剩余因果特征作为输入传递给预测目标的ML模型(多元线性回归、随机森林)之前,过滤掉因果伪链接。我们将该框架应用于西太平洋热带气旋(TC)的统计强度预测,对此往往难以准确选择驱动因子及其降维(时间滞后、垂直层次和区域平均)。在条件独立性检验中使用更严格显著性阈值有助于消除伪因果关系,从而帮助ML模型更好地泛化至未见TC个例。具有精简特征数的M-PC1优于M-PCMCI、非因果ML及其他特征选择方法(滞后相关、随机),甚至略优于基于可解释人工智能的特征选择。从我们的因果特征选择获得的最优因果驱动因子有助于增进对底层关系的理解,并提示了TC增强的新的潜在驱动因子。
引用
@article{arxiv.2304.05294,
title = {Selecting Robust Features for Machine Learning Applications using Multidata Causal Discovery},
author = {Saranya Ganesh S. and Tom Beucler and Frederick Iat-Hin Tam and Milton S. Gomez and Jakob Runge and Andreas Gerhardus},
journal= {arXiv preprint arXiv:2304.05294},
year = {2023}
}
备注
11 pages, 4 figures, 1 table, Supporting Information, Accepted for an oral presentation at the Climate Informatics 2023