中文

基于误标样本视角的简单数据集偏差补救方法:自影响方法

机器学习 2024-11-04 v1 计算机视觉与模式识别

摘要

从有偏数据中学习泛化模型是深度学习中实现公平性的重要课题。为解决此问题,近期研究尝试在无偏差先验知识或无偏数据集的情况下识别并利用无虚假相关性的偏差冲突样本。然而,虚假相关性仍然是一个持续存在的挑战,主要源于精确检测这些样本的困难。本文受误标样本与偏差冲突样本之间相似性的启发,从误标样本检测的新视角来应对这一挑战。具体而言,我们深入研究了影响函数——一种标准的误标样本检测方法——用于识别偏差冲突样本,并提出通过利用它们来为有偏模型提供简单而有效的补救方法。通过在多样化数据集上的全面分析和实验,我们证明这种新视角可以提高检测的精度并有效纠正有偏模型。此外,我们的方法与现有方法互补,即使在已应用近期去偏技术的模型上也能表现出性能提升。

关键词

引用

@article{arxiv.2411.00360,
  title  = {A Simple Remedy for Dataset Bias via Self-Influence: A Mislabeled Sample Perspective},
  author = {Yeonsung Jung and Jaeyun Song and June Yong Yang and Jin-Hwa Kim and Sung-Yub Kim and Eunho Yang},
  journal= {arXiv preprint arXiv:2411.00360},
  year   = {2024}
}