基于对抗机器学习的多源稳定变量重要性度量
统计方法学
2024-12-31 v3
摘要
对暴露协变量的预测重要性进行量化和推断最近在可解释机器学习语境下获得了显著关注。当今的科学调查常常涉及来自多个来源、分布异构的数据。因此,引入一种在不同环境下稳定的变量重要性度量是必不可少的。在本文中,我们引入了MIMAL(Multi-source Importance Measure via Adversarial Learning),一个新的统计框架,旨在通过最大化跨源混合物的最小预测奖励来量化暴露变量的重要性。该提议框架适用于广泛的机器学习方法,用于混淆调整和暴露效应特征描述。我们在一般机器学习框架下建立了数据依赖估计器的渐近正态性。我们的框架所需的学习准确度条件与单源变量重要性分析所需的条件类似。通过包含多样数据生成情景和机器学习实现的大量数值研究,展示了MIMAL的有限样本性能。此外,我们在北京空气污染的实际案例研究中,分析了来自多个位置收集的数据,说明了该方法的实际用途。
引用
@article{arxiv.2409.07380,
title = {Multi-source Stable Variable Importance Measure via Adversarial Machine Learning},
author = {Zitao Wang and Nian Si and Zijian Guo and Molei Liu},
journal= {arXiv preprint arXiv:2409.07380},
year = {2024}
}