中文

冻结视觉基础模型的噪声鲁棒训练重思:基于小损失失败的跨数据集基准

计算机视觉与模式识别 2026-05-22 v1

摘要

冻结视觉基础模型(Frozen Vision Foundation Models, VFMs)配合轻量级分类头在医学影像中日益广泛应用,因其提供高效且可复现的部署方式。然而,针对这一冻结特征 regime 的噪声标签学习方法仍鲜有了解,且大多数现有方法仍依赖于源自端到端训练的小损失假设。我们构建了一个受控基准,测试八种噪声标签方法跨越五个医学数据集、三个骨干网络、两种噪声类型及五种噪声比例(150 种情形、6000 次训练运行),并以平衡准确率进行评估。基准结果表明不存在通用获胜者:基于 150 种情形的 Friedman 排序得 χ2=333.2\chi^2 = 333.2p=4.77×1068p = 4.77 \times 10^{-68}),ELR 在最多情形中获胜(49/150),而 CUFIT 实现最佳平均排名(2.51)。方法选择的实际成本随噪声严重程度呈急則上升,从干净数据上的 4.5pp 增至不对称 40% 噪声下的 18.8pp。为解释这些基准层面的模式,我们在代表性高风险 regime 中重审小损失假设。在冻结的 DINOv2 特征下,干净损失分布与噪声损失分布重合率为 53--61%,且匹配率的干净样本检测显示,在不对称噪声下,预测一致性显著优于损失排序(3pp 与 13pp 的精度下降)。在 ISIC2019 上进行不对称 40% 噪声测试时,Co-Teaching 达到 68% 的总体准确率,但在四个少数类上召回为零,平衡准确率降至 35.1%。综上,这些结果将冻结 VFMs 的噪声标签学习重新阐释为一种而非单一主导算法的 regime 依赖方法选择问题。我们结合证据给出指导意见,并提供一种低后悔的特征空间选择器供实际推荐使用。

关键词

引用

@article{arxiv.2605.22591,
  title  = {Rethinking Noise-Robust Training for Frozen Vision Foundation Models: A Cross-Dataset Benchmark with a Case Study of Small-Loss Failure},
  author = {Zitong Li and Haoyu Wang},
  journal= {arXiv preprint arXiv:2605.22591},
  year   = {2026}
}