通过分数校准实现阈值无关的公平匹配
机器学习
2024-05-31 v1 数据库
摘要
实体匹配是医疗、金融和公共管理等众多领域中的关键任务,因为它识别同一数据库内或跨数据库间指向同一实体的记录。实体匹配面临重大挑战,尤其是假阳性和假阴性。通常通过生成匹配分数并应用阈值来平衡不同上下文中的假阳性和假阴性。然而,调整这些阈值会影响结果的公平性,这一关键因素在当前公平实体匹配研究中很大程度上被忽视。现有的公平实体匹配研究倾向于关注静态阈值,忽略了它们对公平性的关键影响。为解决这一问题,我们在实体匹配中引入了一种新方法,使用近期基于分数的二分类偏差评估指标,特别是通过分布奇偶性的视角。该方法使得无需依赖阈值设置即可应用各种偏差指标,如均衡几率、均衡机会和人口统计奇偶性。我们使用领先的匹配方法进行的实验揭示了潜在的偏差,通过应用基于Wasserstein重心的实体匹配分数校准技术,我们不仅减轻了这些偏差,还在真实世界数据集上保持了准确性。本文通过推广一种生成匹配分数的方法,在不同阈值下减少偏差,为数据清洗领域的公平性做出了贡献,尤其是在实体匹配这一数据清洗的核心任务中。
关键词
引用
@article{arxiv.2405.20051,
title = {Threshold-Independent Fair Matching through Score Calibration},
author = {Mohammad Hossein Moslemi and Mostafa Milani},
journal= {arXiv preprint arXiv:2405.20051},
year = {2024}
}