通过CNN训练得分分析缓解数据集偏差
计算机视觉与模式识别
2021-06-29 v1
摘要
训练数据集对基于卷积神经网络(CNN)的算法至关重要,直接影响其整体性能。因此,使用结构良好且偏差水平最小的数据集始终是值得追求的。本文提出一种新颖的、与领域无关的方法,称为基于得分的重采样(SBR),以根据该训练集所得模型预测得分定位原始训练集中代表性不足的样本。在我们的方法中,一旦训练完成,我们使用同一CNN模型对其自身训练样本进行推断,获得预测得分,并基于预测与真实标签之间的距离,识别出远离其真实标签的样本,并在原始训练集中对其进行增广。降低Sigmoid函数的温度项以更好区分得分。为实验评估,我们选取了一个用于性别分类的Kaggle数据集。我们首先使用结构相对标准的基于CNN的分类器,在训练图像上训练,并在原始数据集提供的验证样本上评估。然后,我们在一个由浅色男性、浅色女性、深色男性、深色女性群体组成的全新测试数据集上评估它。所得准确率存在差异,揭示了原始数据集中存在针对特定群体的类别偏差。随后,我们基于所提方法进行重采样后训练模型。我们将方法与先前提出的基于变分自编码器(VAE)的算法进行比较。所得结果证实了我们所提方法在识别原始数据集中代表性不足样本以减小特定群体分类类别偏差方面的有效性。尽管针对性别分类测试,所提算法可用于考察任何基于CNN任务的数据集结构。
引用
@article{arxiv.2106.14829,
title = {Dataset Bias Mitigation Through Analysis of CNN Training Scores},
author = {Ekberjan Derman},
journal= {arXiv preprint arXiv:2106.14829},
year = {2021}
}
备注
12 pages, 11 figures