REVISE:一种用于度量并缓解视觉数据集中偏差的工具
计算机视觉与模式识别
2021-07-27 v4
摘要
已知机器学习模型会延续甚至放大数据中存在的偏差。然而,这些数据偏差往往直到模型部署后才变得明显。我们的工作解决了这一问题,并实现了对大规模数据集的 preemptive 分析。REVISE(REvealing VIsual biaSEs)是一个辅助调查视觉数据集、沿三个维度揭示潜在偏差的工具:(1) 基于对象,(2) 基于人,以及 (3) 基于地理。基于对象的偏差涉及所描绘对象的大小、上下文或多样性。基于人的度量聚焦于分析数据集中人物的刻画。基于地理的分析考量不同地理位置的表征。这三个维度在如何交互以偏置数据集方面深度交织,REVISE 对此予以揭示;随后责任在于用户考虑文化与历史背景,并判定所揭示的哪些偏差可能存在问题。该工具进一步通过建议可采取的可操作步骤来辅助用户缓解所揭示的偏差。总体而言,我们工作的关键目标是在流程早期解决机器学习偏差问题。REVISE 可在 https://github.com/princetonvisualai/revise-tool 获取。
引用
@article{arxiv.2004.07999,
title = {REVISE: A Tool for Measuring and Mitigating Bias in Visual Datasets},
author = {Angelina Wang and Alexander Liu and Ryan Zhang and Anat Kleiman and Leslie Kim and Dora Zhao and Iroha Shirai and Arvind Narayanan and Olga Russakovsky},
journal= {arXiv preprint arXiv:2004.07999},
year = {2021}
}
备注
Extended version of ECCV 2020 Spotlight paper