基于神经坍缩几何的不可靠标签可靠主动学习
机器学习
2025-10-14 v1 计算机视觉与模式识别
摘要
主动学习(Active Learning, AL)通过优先标注信息量大的样本以降低标注成本,然而当标签存在噪声或数据分布发生偏移时,其可靠性会受到削弱。在实际应用中,标注者会犯错,稀有类别具有歧义性,而传统主动学习启发式方法(不确定性、多样性)往往会反复选择错标或冗余样本,从而放大此类错误。我们提出基于神经坍缩几何的可靠主动学习(NCAL-R),一个利用深度网络涌现的几何规律性来对抗不可靠监督的框架。该方法引入两个互补的信号:(i) 类均值对齐扰动(Class-Mean Alignment Perturbation)得分,用于量化候选样本在结构上稳定或扭曲类间几何的程度;(ii) 特征波动(Feature Fluctuation)得分,用于捕捉跨训练检查点表示的时间不稳定性。通过结合这两个信号,NCAL-R 优先选择既能保持类间可分性又能凸显歧义区域的样本,从而缓解噪声或冗余标签的影响。在 ImageNet-100 和 CIFAR100 上的实验表明,NCAL-R 始终优于标准主动学习基线,在使用更少标签的情况下获得更高准确率,在合成标签噪声下具有更强的鲁棒性,并对分布外数据具有更好的泛化能力。这些结果表明,将几何可靠性准则纳入采集决策,可使主动学习在面对标注错误和分布偏移时不再那么脆弱,这是迈向真实世界标注流水线可信部署的关键一步。代码已开源:https://github.com/Vision-IIITD/NCAL。
引用
@article{arxiv.2510.09740,
title = {Reliable Active Learning from Unreliable Labels via Neural Collapse Geometry},
author = {Atharv Goel and Sharat Agarwal and Saket Anand and Chetan Arora},
journal= {arXiv preprint arXiv:2510.09740},
year = {2025}
}
备注
Accepted to NeurIPS 2025 Workshop on Reliable ML from Unreliable Data