中文

洞察群体不平等:大规模移动预测中的审计与减缓

机器学习 2025-11-03 v1 人工智能

摘要

位置预测是支撑日益增长的移动、零售和公共卫生应用的核心技术,但其社会影响鲜有探讨。本文审计了在大规模数据集上训练的前沿移动预测模型,揭示基于用户人口统计学特征的隐藏差异。我们基于汇总的人口普查数据,计算预测模型在不同种族和民族用户群体上的性能差异,显示由于底层数据集所致,导致根据位置和用户群体不同,准确率存在显著差异。为此,我们提出了公平性导向的增量抽样策略(FGIS),用于增量数据收集场景。由于缺乏个人层面的人口统计学标签,我们引入了大小感知K均值聚类(SAKM),该方法在潜在移动空间中对用户进行分区,同时强制执行人口普查所致的群体比例。这为四大群体(亚裔、黑裔、西班牙裔和白裔)提供了代理种族标签。基于这些标签,我们的抽样算法根据预期性能提升和当前群体代表性优先选择用户。这一方法逐步构建训练数据集,以减少人口统计学性能差距,同时保持整体准确率。我们的方法在MetaPath2Vec模型和变压器编码器模型上将群体间总体差异降低最高可达40%,且几乎没有准确率代价。改进在早期抽样阶段最为显著,凸显了即使在资源有限的环境中,公平性意识的策略也能实现显著的提升。我们的发现揭示了移动预测管道中的结构性不平等,并展示了轻量级、数据中心的干预如何能以极少的额外复杂度提升公平性,尤其适用于低数据应用场景。

关键词

引用

@article{arxiv.2510.26940,
  title  = {Mind the Gaps: Auditing and Reducing Group Inequity in Large-Scale Mobility Prediction},
  author = {Ashwin Kumar and Hanyu Zhang and David A. Schweidel and William Yeoh},
  journal= {arXiv preprint arXiv:2510.26940},
  year   = {2025}
}