Data-IQ:刻画表格数据中具有异质结果的子群
机器学习
2022-10-25 v1 人工智能
摘要
平均意义上的高模型性能,可能掩盖模型在数据的某些子群上系统性表现不佳的事实。我们考虑表格数据场景,其暴露出结果异质性这一独特问题——这在医疗等领域中十分普遍,其中具有相似特征的患者可能拥有不同结果,从而使得可靠预测颇具挑战。为此,我们提出 Data-IQ,一个基于结果对样本进行系统性分层为子群的框架。我们通过分析训练期间单个样本的行为来实现这一点,基于其预测置信度,且重要的是,基于偶然(数据)不确定性。捕捉偶然不确定性允许对数据样本进行原则性刻画,并进而将其分层为三个不同的子群(易、模糊、难)。我们在四个真实世界医疗数据集上实验展示了 Data-IQ 的益处。我们表明,与基线相比,Data-IQ 对样本的分类在具有相似性能(但不同)的模型间的变化最为鲁棒。由于 Data-IQ 可用于任何 ML 模型(包括神经网络、梯度提升等),该性质确保了数据刻画的一致性,同时允许灵活的模型选择。更进一步,我们展示这些子群使我们能够构建特征获取与数据集选择的新方法。此外,我们强调子群如何为可靠模型使用提供指引,并指出模糊子群对模型泛化的显著影响。
引用
@article{arxiv.2210.13043,
title = {Data-IQ: Characterizing subgroups with heterogeneous outcomes in tabular data},
author = {Nabeel Seedat and Jonathan Crabbé and Ioana Bica and Mihaela van der Schaar},
journal= {arXiv preprint arXiv:2210.13043},
year = {2022}
}
备注
Presented at NeurIPS 2022