子集修复的表示成本
数据库
2024-10-23 v1
摘要
数据集可能包含各种类型的错误,特别是完整性约束的违反。标准的“最小成本”数据库修复技术通过寻求对数据进行最小修改来解决这些违反,过程中可能导致不同子人口表述的偏移。例如,修复可能导致对女性的删除多于男性,或来自某一年龄组或种族的元组被删除更多,这取决于不同子人口中不一致程度的差异。使用这些修复后的数据进行分析可能会误导消费者,并导致下游机器学习任务产生偏见。我们研究了子集修复中“表示成本”。简单地说,我们聚焦于如果希望同时满足完整性约束和给定子人口的表示约束,需要额外删除多少个元组的问题。我们研究了该问题的复杂度,并将其与没有表示约束的子集修复的复杂度进行了比较。虽然该问题在一般情况下是 NP-hard 的,但我们给出了特殊情况下的多项式时间算法,并为一般情况提供了高效启发式方法。我们进行一系列实验,显示我们算法在计算或近似表示成本方面的有效性。
引用
@article{arxiv.2410.16501,
title = {The Cost of Representation by Subset Repairs},
author = {Yuxi Liu and Fangzhu Shen and Kushagra Ghosh and Amir Gilad and Benny Kimelfeld and Sudeepa Roy},
journal= {arXiv preprint arXiv:2410.16501},
year = {2024}
}
备注
full version, to appear at VLDB25