SAP:面向标签噪声鲁棒性的缩放激活投影校正性机器遗忘
机器学习
2025-01-03 v2 人工智能
机器学习
摘要
标签损坏,即训练样本因非专家标注或对抗攻击而被错误标记,会显著降低模型性能。获取大规模、完美标注的数据集成本高昂,而从头重新训练模型计算代价巨大。为解决此问题,我们引入缩放激活投影 (SAP),一种新颖的基于 SVD(奇异值分解)的校正性机器遗忘算法。SAP 通过使用交叉熵损失识别一小部分可信样本,并将模型权重投影到利用这些可信样本上的 SVD 估计出的干净激活空间,从而减轻标签噪声。此过程抑制了因错误标记样本而在激活中引入的噪声。在我们的实验中,我们展示了 SAP 在不同设置的合成噪声和真实世界标签噪声上的有效性。将 SAP 应用于具有 25% 合成损坏的 CIFAR 数据集,显示出高达 6% 的泛化改进。此外,SAP 在 CIFAR 数据集上相比噪声鲁棒训练方法,平均可将泛化性能提升约 3.2%。进一步地,我们观察到在自然损坏的 Clothing1M 上训练的 Vision Transformer 模型泛化性能提升了 2.31%。
引用
@article{arxiv.2403.08618,
title = {SAP: Corrective Machine Unlearning with Scaled Activation Projection for Label Noise Robustness},
author = {Sangamesh Kodge and Deepak Ravikumar and Gobinda Saha and Kaushik Roy},
journal= {arXiv preprint arXiv:2403.08618},
year = {2025}
}