基于表格数据的统计自监督学习的可解释特征交互
机器学习
2025-03-25 v1 机器学习
摘要
在高维和高风险情境中,确保从复杂表格数据中进行特征提取的严格统计保证和可解释性仍然是一个巨大的挑战。传统方法如主成分分析 (PCA) 能够降低维度并识别解释方差最主要的特征,但受限于其对线性假设的依赖。相比之下,神经网络通过自监督学习技术(如自编码器)提供无假设的特征提取,但其可解释性在需要透明度的领域仍然是一个挑战。为此,本文引入了 Spofe,这是一种新的自监督机器学习管道,将核主成分的强大能力与稀疏且原则化的多项式表示相结合,以实现统计严谨性下的清晰可解释性。支撑我们方法的是一种健壮的理论框架,提供精确的误差界和严格的假发现率 (FDR) 控制,通过多目标 knockoff 选择程序实现;它通过三个阶段有效地桥接了数据驱动的复杂性与统计可靠性:(1) 使用核主成分生成自监督信号以建模复杂模式,(2) 将这些信号提炼为稀疏多项式函数以提高可解释性,(3) 应用多目标 knockoff 选择程序进行显著性检验,以严格识别重要特征。广泛的在多样化真实数据集上的实验表明,Spofe 在回归和分类任务中始终优于 KPCA、SKPCA 和其他方法。可视化和案例研究突显了其发现关键见解的能力,增强了可解释性和实际效用。
引用
@article{arxiv.2503.18048,
title = {Interpretable Feature Interaction via Statistical Self-supervised Learning on Tabular Data},
author = {Xiaochen Zhang and Haoyi Xiong},
journal= {arXiv preprint arXiv:2503.18048},
year = {2025}
}