基于聚类的名称嵌入在现实名称损坏下减少选民注册记录链中的族裔差异
摘要
差异的族裔基于记录链错误会偏差流行病学估计。以往的证据常将错误机制的异质性与不平等的暴露于错误混合在一起。使用北卡罗来纳选民注册册的快照(2011 年 10 月至 2022 年 10 月),我们推导了经验的名称差异轮廓,以参数化现实的损坏。从 2022 年 10 月的提取中(n=848,566),我们生成了五个复制损坏数据集,在三个设置下分别变化机制异质性和暴露不平等,并使用未调整的 Jaro-Winkler、Term Frequency(TF)调整的 Jaro-Winkler 以及结合 TF 调整的姓氏比较的基于聚类的前名嵌入比较器将记录链接回原始记录。我们评估了虚假匹配率(FMR)、漏检率(MMR)以及白人中心的差异。在固定的 MMR 接近 0.20 时,整体错误率和族裔差异在不同模型下差异显著。Term-frequency(TF)调整的 Jaro-Winkler 在整体 MMR 为 20.34%(20.30-20.39)时实现了非常低的整体 FMR(0.55%(95% CI 0.54-0.57)),但仍存在大型白人中心的链接差异:希拉族选民的 FMR 高出 36.3%(36.1-36.6)和非希拉族裔黑人选民 8.6%(8.6-8.7),与非希拉族裔白人群组相比。相对于未调整的字符串相似性,TF 调整减少了这些差异(希拉族:+60.4%(60.1-60.7)至 +36.3%;黑人:+13.1%(13.0-13.2)至 +8.6%)。基于聚类的前名嵌入模型进一步缩小了漏检差异(希拉族:+10.2%(9.8-10.3);黑人:+0.6%(0.4-0.7)),但以增加整体 FMR(4.28%(4.22-4.35))为代价。在相同的阈值下。不平等的暴露于标识符错误驱动的差异远大于机制异质性本身;基于聚类的嵌入显著缩小了链接差异。
关键词
引用
@article{arxiv.2601.07692,
title = {R3DPA: Leveraging 3D Representation Alignment and RGB Pretrained Priors for LiDAR Scene Generation},
author = {Nicolas Sereyjol-Garros and Ellington Kirby and Victor Besnier and Nermin Samet},
journal= {arXiv preprint arXiv:2601.07692},
year = {2026}
}
备注
ICRA 2026