中文

TARA:面向AI公平性与域泛化的训练与表征改写方法

机器学习 2021-08-23 v4 计算机视觉与模式识别

摘要

我们提出一种针对受保护或敏感因素 enforcing AI公平性的新方法。该方法采用双重策略执行训练与表征改写(TARA),以缓解AI偏差的主要成因,包括:a) 通过对抗独立性进行表征学习改写,抑制数据表征对受保护因素的偏差诱导依赖;b) 通过智能增强进行训练集改写,利用生成模型借助域适应与潜空间操控对与代表性不足群体相关的敏感因素实现精细控制,从而解决致偏数据不平衡。在图像分析上测试我们的方法时,实验表明TARA显著或完全去偏了基线模型,同时优于信息量相同的竞争去偏方法,例如在EyePACS上(总体准确率%,准确率差距%)=(78.8, 0.5)对比基线方法的(71.8, 10.5),在CelebA上为(73.7, 11.8)对比(69.1, 21.7)。此外,认识到当前用于评估去偏性能的度量存在某些局限,我们提出了新的合取去偏度量。我们的实验也展示了这些新度量在评估所提方法帕累托有效性方面的能力。

关键词

引用

@article{arxiv.2012.06387,
  title  = {TARA: Training and Representation Alteration for AI Fairness and Domain Generalization},
  author = {William Paul and Armin Hadzic and Neil Joshi and Fady Alajaji and Phil Burlina},
  journal= {arXiv preprint arXiv:2012.06387},
  year   = {2021}
}

备注

Accepted for publication in MIT Neural Computation