关联数据正确推断的实用方法
统计方法学
2022-02-10 v2 数据库
机器学习
摘要
实体分辨(ER),包括记录链接与去重,是在缺乏唯一标识符的情况下合并含噪数据库以去除重复实体的过程。关联数据分析的一个主要挑战是:在已确定的匹配中识别一条代表性记录传递给推断或预测任务(称为\emph{下游任务})。此外,在下游任务中纳入来自 ER 的不确定性对于确保正确推断至关重要。为弥合分析流水线中 ER 与下游任务之间的鸿沟,我们提出五种从关联数据中选择代表性(或规范)记录的方法,称为规范化(canonicalization)。我们的方法在记录数量上可扩展,适用于一般数据场景,并通过贝叶斯规范化阶段提供自然的误差传播。所提方法在三个模拟数据集和一个应用上进行了评估——确定北卡罗来纳州选举委员会选民登记数据中人口统计信息与党派归属之间的关系。我们首先执行贝叶斯 ER 并评估所提规范化方法,再考虑线与逻辑回归的下游任务。经验表明,贝叶斯规范化方法通过预测与覆盖在两种设置下均改善了下游推断。
引用
@article{arxiv.1810.01538,
title = {A Practical Approach to Proper Inference with Linked Data},
author = {Andee Kaplan and Brenda Betancourt and Rebecca C. Steorts},
journal= {arXiv preprint arXiv:1810.01538},
year = {2022}
}
备注
31 pages, 2 figures