有限数据场景下基于混合样本合成的分类器去偏方法
计算机视觉与模式识别
2023-12-21 v2 机器学习
摘要
众所周知,深度学习模型存在偏差问题,研究人员一直在探索解决此问题的方法。然而,这些方法大多需要关于偏差的先验知识,并不总是实用。本文聚焦于一种更实际的场景,即没有关于偏差的先验信息。通常,在此场景下,存在大量符合偏差的样本,导致模型产生有偏预测,以及少量不符合偏差的样本。如果训练数据有限,符合偏差样本对模型预测的影响可能会变得更强,我们通过实验证明,现有的去偏技术在此类情况下会受到严重影响。本文研究了小数据集场景下未知偏差的影响,并提出了一种缓解此问题的新方法。所提方法通过合成混合样本,直接解决了有限数据场景下不符合偏差样本出现概率极低的问题,这些混合样本可用于降低偏差的影响。我们在多个基准数据集上进行了大量实验,并通过实验证明了所提方法在有限数据条件下处理任何未知偏差的有效性。具体而言,当仅有10%的Corrupted CIFAR-10 Type 1数据集可用,且不符合偏差样本比例为0.05时,我们的方法分别以10.39%、9.08%、8.07%和9.67%的绝对优势超越了vanilla、LfF、LDD和DebiAN去偏方法。
引用
@article{arxiv.2312.08288,
title = {Hybrid Sample Synthesis-based Debiasing of Classifier in Limited Data Setting},
author = {Piyush Arora and Pratik Mazumder},
journal= {arXiv preprint arXiv:2312.08288},
year = {2023}
}
备注
Accepted in WACV 2024