中文

使用影响函数检测标签偏差

机器学习 2026-02-24 v1 人工智能

摘要

标签偏差源于数据收集中的资源限制或无意偏见,导致不同子群中标签错误率不均或子群先验的误表示。大多数公平性约束假设训练标签反映真实分布,因而在标签偏差存在时无效;留下关键问题:我们该如何检测此类标签偏差?本文研究影响函数能否用于检测标签偏差。影响函数通过利用损失函数的梯度和 Hessian 估计每个训练样本对模型预测的影响程度——当标签出错时,影响函数可识别训练集中的错误标签,从揭示底层失效模式。我们开发了样本评估管道,首先在 MNIST 数据集上进行测试,再扩展到更复杂的 CheXpert 医学影像数据集。为检验标签噪声,我们通过翻转一个类别中 20% 的标签引入受控错误。使用对角线 Hessian 近似,我们展示了有希望的结果,成功检测了 MNIST 中近 90% 的错误标签。在 CheXpert 上,错误标签的样本表现出更高的影响分数。这些结果凸显了影响函数用于识别标签错误的潜力。

关键词

引用

@article{arxiv.2602.19130,
  title  = {Detecting labeling bias using influence functions},
  author = {Frida Jørgensen and Nina Weng and Siavash Bigdeli},
  journal= {arXiv preprint arXiv:2602.19130},
  year   = {2026}
}