中文

偏离留下了梯度轨迹:基于概念分解的无标签偏差识别

计算机视觉与模式识别 2026-05-28 v1 机器学习

摘要

视觉分类器可利用虚假关联实现高准确率,但在分布迁移时往往失效。现有方法往往依赖精心构建的数据集、虚假属性或群组标签,或需要重新训练,这在模型部署后或相关偏差未知时往往不可行。我们提出一种无标签、后处理的方法,用于识别冻结视觉模型中的虚假概念,仅依赖于持留外审计数据集中的标准类别标签。对于每个目标类别,我们收集被预测为该类别的输入数据块,并应用非负矩阵分解获取可解释的概念向量库。随后通过基于误分类样本上反向传播梯度的偏差估计器对候选概念进行排序:偏差概念在纠正假阴性时倾向于被激活,在纠正假阳性时则被抑制。在Colored MNIST和Waterbirds上,该方法恢复与已知虚假线索一致的概念;在CelebA上则表面出部分与标注性别属性不完全吻合的决策相关方向;在推断时抑制顶部排序的概念可使Waterbirds上最差群体准确率提升最高达17.9个百分点,CelebA上提升10.4个百分点,且无需任何重新训练或参数更新。该方法识别决策相关的虚假方向无需与标注一致,为冻结视觉模型提供可解释的审计工具和可操作的去偏处理手段。代码已公开于https://github.com/vitryt/label-free-bias-identification。

关键词

引用

@article{arxiv.2605.28780,
  title  = {Bias Leaves a Gradient Trail: Label-Free Bias Identification via Gradient Probes on Concept Decompositions},
  author = {Thomas Vitry and Kieran Edgeworth and Stefan Wermter and Jae Hee Lee},
  journal= {arXiv preprint arXiv:2605.28780},
  year   = {2026}
}

备注

Accepted to the 49th German Conference on Artificial Intelligence (KI2026)