中文

分类问题中高阶特征效应的信息论量化

机器学习 2025-07-08 v1 数据分析、统计与概率 机器学习

摘要

理解预测模型中单个特征的贡献仍是可解释机器学习中的核心目标,而许多现有的模型无关方法在捕捉高阶相互作用和消除重叠贡献方面常常不足。本文提出了一种信息论扩展的高阶特征重要性(Hi-Fi)方法,利用通过k近邻(kNN)方法估计的条件互信息(CMI),该方法可处理混合离散和连续随机变量。我们的框架将特征贡献分解为唯一贡献、协同贡献和冗余贡献,为其预测作用提供更丰富、模型无关的理解。我们使用具有已知高斯结构的合成数据集进行验证,其中可解析地推导了ground truth互动模式,并进一步在非高斯数据和来自TCGA-BRCA的真实基因表达数据上进行测试。结果表明,所提出的估计器能够准确恢复理论和预期结果,为基于互动分析开发特征选择算法或模型开发提供了潜在用例。

关键词

引用

@article{arxiv.2507.04362,
  title  = {Information-theoretic Quantification of High-order Feature Effects in Classification Problems},
  author = {Ivan Lazic and Chiara Barà and Marta Iovino and Sebastiano Stramaglia and Niksa Jakovljevic and Luca Faes},
  journal= {arXiv preprint arXiv:2507.04362},
  year   = {2025}
}