中文

Data AUDIT:在任务模型中识别由属性效用与可检测性引发的偏置

机器学习 2023-04-07 v1 计算机视觉与模式识别

摘要

为了安全地部署基于深度学习的计算机视觉模型用于计算机辅助检测与诊断,我们必须确保其鲁棒性和可靠性。为此,算法审计已受到广泛关注。现有方法依赖启发式方法或高层目标(例如,就受保护属性如性别、社会性别或种族而言的非歧视)来指导审计流程。然而,算法可能相对于超出这些更明显属性之外的各种属性表现出偏置,且与这些更微妙属性相关的完整性问题可能产生严重后果。为了生成可操作的、数据驱动的假设以识别可能引发模型偏置的特定数据集属性,我们提出了一种用于对医学图像数据集进行严格定量筛查的首个技术。借鉴因果推断与信息论领域的文献,我们的流程根据数据集属性的可检测性及其效用(定义为已知该属性所能提供的关于任务标签的信息量)来分解与之相关的风险。为证明方法的有效性与敏感性,我们构建了多种带有合成插入伪影的数据集,这些伪影与目标标签具有不同程度的关联,从而可通过与真实反事实样本对比性能来评估继承的模型偏置。利用这些数据集及数百个训练模型的结果,我们表明我们的筛查方法能可靠地识别几乎不可察觉的致偏伪影。最后,我们将方法应用于一个流行皮肤病变数据集的自然属性并证明了其成功。我们的方法为执行更系统的算法审计并指导未来数据收集工作以追求更安全可靠的模型提供了手段。

关键词

引用

@article{arxiv.2304.03218,
  title  = {Data AUDIT: Identifying Attribute Utility- and Detectability-Induced Bias in Task Models},
  author = {Mitchell Pavlak and Nathan Drenkow and Nicholas Petrick and Mohammad Mehdi Farhangi and Mathias Unberath},
  journal= {arXiv preprint arXiv:2304.03218},
  year   = {2023}
}

备注

11 pages, 5 figures