无模型特征选择以促进表格数据中发散子群的自动发现
机器学习
2022-03-10 v1 人工智能
信息论
信号处理
math.IT
摘要
以数据为中心的 AI 强调需要清理和理解数据以实现可信 AI。现有技术(如 AutoML)使自动设计和训练模型更加容易,但缺乏类似水平的能力来提取以数据为中心的洞见。按特征(如性别)对表格数据进行人工分层难以扩展到更高特征维度,这可通过发散子群的自动发现来解决。然而,这些自动发现技术通常搜索潜在指数级的特征组合,若采用前置特征选择步骤可加以简化。现有的表格数据特征选择技术常涉及拟合特定模型以选择重要特征。但此类基于模型的选择容易产生模型偏差和伪相关,且需额外资源来设计、微调和训练模型。本文提出一种无模型且基于稀疏性的自动特征选择(SAFS)框架,以促进发散子群的自动发现。与基于过滤的选择技术不同,我们利用特征值间目标度量的稀疏性来对特征排序和选择。我们在两个公开数据集(MIMIC-III 和 Allstate Claims)上验证 SAFS,并与六种现有特征选择方法比较。SAFS 在 MIMIC-III 和 Claims 数据集上分别实现特征选择时间相较现有方法平均减少 81 倍和 104 倍。SAFS 选择的特征也展现出有竞争力的检测性能,例如,Claims 数据集中 SAFS 选择的 18.3% 特征检测出的发散样本与使用全部特征检测出的样本相似(Jaccard 相似度 0.95),而检测时间减少 16 倍。
引用
@article{arxiv.2203.04386,
title = {Model-free feature selection to facilitate automatic discovery of divergent subgroups in tabular data},
author = {Girmaw Abebe Tadesse and William Ogallo and Celia Cintas and Skyler Speakman},
journal= {arXiv preprint arXiv:2203.04386},
year = {2022}
}