中文

想象一名工程师:论基于GAN的数据增强对偏见的延续

机器学习 2018-11-12 v1 人工智能 机器学习

摘要

使用生成对抗网络(GAN)生成的合成数据已成为许多应用进行数据增强的颇受欢迎的方法。从业者将其誉为获取更多可用于训练下游分类器的合成数据的经济方式,但他们是否认识到该技术的固有缺陷尚不清楚。本文旨在告诫从业者不要基于数据增强对数据偏见产生任何虚假的安全感。为阐明此点,我们展示:从一个由工程研究人员头部照片组成的数据集出发,基于GAN的增强“想象”出合成工程师,其中多数具有男性化特征与白人肤色(由在Amazon Mechanical Turk上进行的人体受试者研究推断)。这展示了训练数据中固有的偏见如何被基于GAN的数据增强强化,有时甚至放大;其应作为对普通从业者的警示寓言。

关键词

引用

@article{arxiv.1811.03751,
  title  = {Imagining an Engineer: On GAN-Based Data Augmentation Perpetuating Biases},
  author = {Niharika Jain and Lydia Manikonda and Alberto Olmo Hernandez and Sailik Sengupta and Subbarao Kambhampati},
  journal= {arXiv preprint arXiv:1811.03751},
  year   = {2018}
}

备注

6 pages, 6 figures