通过硬度基于重抽样消除数据平衡数据集中的类别偏差
机器学习
2026-04-13 v2
摘要
类别偏差,即类别间性能差异,通常归因于数据不平衡并通过频率基于的重抽样方法加以缓解。然而,我们证明即使在完全平衡的数据集中,偏差仍然显著,表明类别频率本身无法完全解释模型性能的不均等。我们从类别学习难度的视角出发,提出硬度基于重抽样(Hardness-Based Resampling, HBR)策略,利用硬度估计指导数据选择。为更好地捕捉这些效应,我们引入一种评估协议,将全局指标与基于间隙和离散程度的措施相结合。我们的实验表明,HBR 在 CIFAR-10 上显著降低召回率间隙,最高可降低 32%,在 CIFAR-100 上降低 16%,超越标准频率基于的重抽样方法。我们进一步展示,通过选择性地使用来自最先进扩散模型中最难的样本(而非随机选择),可改善公平性结果。这些发现表明,数据平衡本身不足以缓解类别偏差,迫切需要转向基于硬度的 метод。
引用
@article{arxiv.2504.07031,
title = {Reducing Class Bias In Data-Balanced Datasets Through Hardness-Based Resampling},
author = {Pawel Pukowski and Venet Osmani},
journal= {arXiv preprint arXiv:2504.07031},
year = {2026}
}
备注
Submitted to Springer ML