中文

机器学习模型中误差控制的非加性交互作用发现

机器学习 2025-02-17 v2 应用统计 机器学习

摘要

机器学习(ML)模型是检测数据中复杂模式的强大工具,但其“黑盒”特性限制了其可解释性,阻碍了它们在医疗和金融等关键领域的应用。为了应对这一挑战,已经开发了可解释的 ML 方法来解释特征如何影响模型预测。然而,这些方法通常关注单变量特征重要性,忽略了 ML 模型能够捕获的特征之间的复杂交互作用。认识到这一局限性,近期的努力旨在扩展这些方法以发现特征交互作用,但现有方法在鲁棒性和误差控制方面存在困难,尤其是在数据扰动下。在本研究中,我们引入了 Diamond,一种用于可信特征交互发现的新方法。Diamond 独特地集成了 model-X knockoffs 框架来控制错误发现率(FDR),确保错误发现的交互作用比例保持在较低水平。Diamond 的一项关键创新是其非加性蒸馏过程,该过程改进了现有的交互重要性度量以蒸馏非加性交互效应,确保维持 FDR 控制。该方法解决了现成交互度量的局限性,这些度量在被简单使用时可能导致不准确的发现。Diamond 的适用性涵盖广泛的 ML 模型,包括深度神经网络、Transformer 模型、基于树的模型和基于分解的模型。我们在各种生物医学研究的模拟和真实数据集上的实证评估证明了 Diamond 在实现更可靠的数据驱动科学发现方面的效用。该方法代表了在部署 ML 模型以进行科学创新和假设生成方面迈出的重要一步。

关键词

引用

@article{arxiv.2408.17016,
  title  = {Error-controlled non-additive interaction discovery in machine learning models},
  author = {Winston Chen and Yifan Jiang and William Stafford Noble and Yang Young Lu},
  journal= {arXiv preprint arXiv:2408.17016},
  year   = {2025}
}

备注

Accepted by Natural Machine Intelligence