并非所有遗忘都相同:面部图像分类器中架构相关的保留动力学
机器学习
2026-04-17 v2 人工智能
摘要
微调预训练图像分类器已成为标准做法,但究竟哪些单个样本在此过程中被遗忘,以及遗忘模式是否稳定或取决于网络架构,仍不为人知。理解这些动力学直接影响课程设计、数据修剪和集成构建。我们在微调 ResNet-18 和 DeiT-Small 时跟踪每个样本在每个 epoch 的正确性,使用埃布ingham指数衰减曲线拟合每个样本的保留轨迹。得出五项发现:第一,两种架构遗忘根本不同的样本:在 OCTDL 上,最被遗忘的前 10% 样本的 Jaccard 重叠为 0.34,在 CUB-200 上为 0.15。第二,ViT 的遗忘更结构化(平均 ),而 CNN 的遗忘为 。第三,单个样本的遗忘在随机种子间是随机的(Spearman ),挑战了样本难度是内在属性的假设。第四,类别级遗忘是一致的且具有语义可解释性:视觉上相似的物种遗忘最多,区别性较强的物种遗忘最少。第五,样本在 head warmup 后的损失可预测其长期衰减常数( 到 ,)。这些发现表明,架构多样性的集成提供了互补的保留覆盖,基于每个样本难度的课程或修剪方法可能无法在不同运行中普遍适用。基于这些衰减常数的间隔重复采样器不优于随机采样,表明静态调度无法利用不稳定的单个样本信号。
引用
@article{arxiv.2604.11508,
title = {Not All Forgetting Is Equal: Architecture-Dependent Retention Dynamics in Fine-Tuned Image Classifiers},
author = {Miit Daga and Swarna Priya Ramu},
journal= {arXiv preprint arXiv:2604.11508},
year = {2026}
}
备注
This manuscript is currently under consideration at Pattern Recognition Letters