DIWIFT:发现表格数据的实例级影响特征
机器学习
2023-02-14 v2
摘要
表格数据是零售、银行和电子商务等许多现实世界网络应用背后最常见的数据存储格式之一。这些网络应用的成功在很大程度上取决于所采用的机器学习模型能否准确地区分表格数据中所有预定特征中的影响特征。直观上,在实际业务场景中,不同的实例应对应于不同的影响特征集,并且同一实例的影响特征集在不同场景下也可能不同。然而,大多数现有方法都专注于全局特征选择,假设所有实例具有相同的影响特征集,而少数考虑实例级特征选择的方法则忽略了影响特征在不同场景下的可变性。在本文中,我们首先引入了一种基于影响函数进行实例级特征选择的新视角,并给出了一些相应的理论见解,其核心是使用影响函数作为衡量实例级特征重要性的指标。然后,我们提出了一种用于发现表格数据中实例级影响特征的新解决方案(DIWIFT),其中使用自注意力网络作为特征选择模型,并将相应影响函数的值作为优化目标来指导模型。得益于影响函数的优势,即其计算不依赖于特定架构,并且还能考虑不同场景下的数据分布,我们的DIWIFT具有更好的灵活性和鲁棒性。最后,我们在合成数据集和真实世界数据集上进行了大量实验,以验证我们DIWIFT的有效性。
引用
@article{arxiv.2207.02773,
title = {DIWIFT: Discovering Instance-wise Influential Features for Tabular Data},
author = {Dugang Liu and Pengxiang Cheng and Hong Zhu and Xing Tang and Yanyu Chen and Xiaoting Wang and Weike Pan and Zhong Ming and Xiuqiang He},
journal= {arXiv preprint arXiv:2207.02773},
year = {2023}
}
备注
Accepted by TheWebConf 2023 Research Tracks