Tab-Shapley:识别Top-k表格数据质量洞察
机器学习
2025-01-14 v1 机器学习
摘要
我们提出了一种无监督方法,通过识别top-k表格数据质量洞察来聚合表格数据集中的异常。每个洞察由一组异常属性和作为提供给用户证据的相应记录子集组成。由于以下原因,识别这些洞察块的过程具有挑战性: 缺乏带标签的异常, 子集搜索空间的指数级规模,以及 掩盖异常真实来源的属性间复杂依赖关系。简单的基于频率的方法无法捕捉这些依赖关系,导致结果不准确。为了解决这个问题,我们引入了Tab-Shapley,这是一个基于合作博弈论的框架,使用Shapley值来量化每个属性对数据异常性质的贡献。虽然计算Shapley值通常需要指数时间,但我们证明了我们的博弈存在闭式解,使得计算高效。我们通过在具有真实异常标签的真实世界表格数据集上的实证分析验证了该方法的有效性。
引用
@article{arxiv.2501.06685,
title = {Tab-Shapley: Identifying Top-k Tabular Data Quality Insights},
author = {Manisha Padala and Lokesh Nagalapatti and Atharv Tyagi and Ramasuri Narayanam and Shiv Kumar Saini},
journal= {arXiv preprint arXiv:2501.06685},
year = {2025}
}
备注
Accepted at AAAI-25