中文

面向各种网络结构的 Lipschitz 常数贝叶斯表头及其在解决视觉 Transformer 中语义相近分类错误中的应用

计算机视觉与模式识别 2026-05-08 v1 人工智能

摘要

标签噪声仍是监督深度学习模型泛化的关键瓶颈,尤其是在结构化而非随机的错误情况下。标准的鲁棒训练方法在面对此类语义相近分类错误时往往难以奏效。本文提出了一种面向各种网络结构的 Lipschitz 常数贝叶斯表头,可集成到诸如视觉 Transformer 等特征提取器中,从而实现基于 Lipschitz 约束的贝叶斯视觉 Transformer (LipB-ViT)。与常规贝叶斯层不同,我们对变分权重的均值和对数方差都施加谱范数,这有助于获得校准的预测不确定性并减缓噪声放大。我们进一步提出了一种新指标,联合捕捉误分类率下的不确定性和置信度,并提出一种自适应算术平均融合方案,将特征空间的接近性与预测不确定性结合,以检测被污染的标签,该方法超越了基于 k 最近邻的先进方法超过 7%,在 15% 语义误分类标签下达到超过 0.93 的召回率。虽然由于蒙特卡洛抽样而增加了计算成本,但该方法提供了与预训练主干网络的即插即用兼容性以及跨域一致的超参数,表明在标注可靠性具有变量性的高风险应用中具有强大的实用价值。稳定的置信度估计为评估数据集质量和标签噪声的分析管道提供了基础,进而推出了一种用于联合量化的数据集质量和标签噪声的第二个新指标。最后,我们在结构化(对抗性)和非结构化噪声以及推理时间的攻击场景下系统评估了 LipB-ViT,展示了其在现实高噪声和攻击情景下的鲁棒性。我们将其性能与基线方法进行了比较。

关键词

引用

@article{arxiv.2605.05908,
  title  = {Architecture-agnostic Lipschitz-constant Bayesian header and its application to resolve semantically proximal classification errors with vision transformers},
  author = {Frederik Schäfer and Luis Mandl and Lars Kälber and Tim Ricken},
  journal= {arXiv preprint arXiv:2605.05908},
  year   = {2026}
}

备注

10 pages, 3 figures, 4 tables; Supplementary 5 pages with 5 figures; Including references total 18 pages