BiasBuster:一种使用有偏位置数据准确估计人口统计的神经方法
机器学习
2024-02-20 v1 计算机与社会
数据库
摘要
尽管非常有用(例如用于COVID-19预测和政策制定、城市交通分析和市场营销、以及获取商业洞察),但从移动设备收集的位置数据通常包含来自有偏人口子集的数据,某些社区在收集的数据集中代表性过高或不足。因此,从这些数据集计算出的汇总统计量(如Safegraph、Google和Facebook等公司所做的那样),如果忽略偏差,会导致人口统计的不准确表示。这些统计量不仅通常不准确,而且误差会对不同人口子群产生不成比例的影响(例如,因为它们忽略了代表性不足的社区)。这会产生严重后果,因为这些数据集被用于敏感决策,如COVID-19政策制定。本文解决了使用此类有偏数据集提供准确人口统计的问题。我们表明,统计去偏虽然在某些情况下有用,但往往无法提高准确性。然后我们提出了BiasBuster,一种神经网络方法,利用人口统计与位置特征之间的相关性来提供准确的人口统计估计。在真实世界数据上的大量实验表明,BiasBuster总体上将准确性提高了2倍,对于代表性不足的人群提高了3倍。
引用
@article{arxiv.2402.11318,
title = {BiasBuster: a Neural Approach for Accurate Estimation of Population Statistics using Biased Location Data},
author = {Sepanta Zeighami and Cyrus Shahabi},
journal= {arXiv preprint arXiv:2402.11318},
year = {2024}
}