评估严重急性呼吸综合征数据集上的预训练偏差
机器学习
2024-08-29 v1 计算机视觉与模式识别
摘要
机器学习(ML)是计算机科学中一个不断发展的领域,已在包括健康在内的多个领域找到了许多实际应用。然而,随着数据规模和可用性的增长,以及旨在辅助或替代人类决策的模型数量的增加,引发了一个担忧,即这些模型可能容易受到偏差的影响,这可能导致基于受保护属性(如性别、宗教、性取向、种族等)做出决策而对特定个体造成伤害。可视化技术可以产生见解并帮助总结大型数据集,使数据科学家能够在训练模型之前通过评估应用于数据集的预训练指标来更好地理解数据,这可能在投入任何精力训练和部署模型之前有助于识别潜在危害。本工作使用来自OpenDataSUS的严重急性呼吸综合征数据集,可视化了三个预训练偏差指标及其在巴西不同地区的分布。在每个地区训练一个随机森林模型,并将其应用于其他地区。目的是比较不同地区的偏差,重点关注其受保护属性,并将模型性能与指标值进行比较。
引用
@article{arxiv.2408.15398,
title = {Evaluating Pre-Training Bias on Severe Acute Respiratory Syndrome Dataset},
author = {Diego Dimer Rodrigues},
journal= {arXiv preprint arXiv:2408.15398},
year = {2024}
}
备注
short paper for eurovis, 5 pages