中文

揭示个人信息化系统中的偏差

计算机与社会 2023-07-27 v2 机器学习

摘要

由智能手机和可穿戴设备驱动的个人信息化(PI)系统,通过提供有意义且可操作的洞察,打破用户与其健康信息之间的障碍,帮助人们过上更健康的生活。如今,数十亿用户使用此类系统监测身体活动和睡眠,以及生命体征、女性健康、心脏健康等。尽管使用广泛,敏感 PI 数据的处理可能存在偏差,这会带来实际与伦理方面的影响。在本工作中,我们首次对 PI 系统中的偏差进行了全面的实证与分析研究,包括原始数据以及整个机器学习生命周期中的偏差。我们使用迄今最细致的框架来探究偏差的不同来源,发现偏差既存在于数据生成流,也存在于模型学习与实现流中。根据我们的结果,受影响最大的少数群体是患有糖尿病、关节问题和高血压等健康问题的用户,以及女性用户,其数据偏差被学习模型传播甚至放大,同时也可观察到交叉性偏差。

关键词

引用

@article{arxiv.2303.15592,
  title  = {Uncovering Bias in Personal Informatics},
  author = {Sofia Yfantidou and Pavlos Sermpezis and Athena Vakali and Ricardo Baeza-Yates},
  journal= {arXiv preprint arXiv:2303.15592},
  year   = {2023}
}