平均值的谎言:类增量学习评估如何欺骗你?
机器学习
2026-03-05 v2
摘要
类增量学习(CIL)要求模型在不遗忘已学类别的情况下持续学习新类别,同时在所有可能的类别序列上保持稳定的性能。在真实场景中,类别到达的顺序多样且不可预测,模型性能在不同序列间可能存在显著差异。然而,主流评估协议仅从少量随机采样的序列中计算均值和方差。我们的理论分析和实验结果表明,这种采样策略无法覆盖完整的性能范围,导致均值估计存在偏差,并严重低估了性能分布的真实方差。因此,我们认为稳健的 CIL 评估协议应当准确刻画并估计整个性能分布。为此,我们引入了极端序列的概念,并为其在 CIL 可靠评估中的关键作用提供了理论论证。此外,我们观察到任务间相似性与模型性能之间存在一致的正相关性,这一关系可用于指导极端序列的搜索。基于这些发现,我们提出了 EDGE(基于极端案例的分布与泛化评估),这是一种利用任务间相似性自适应识别并采样极端类别序列的评估协议,能够更近似地反映真实性能分布。大量实验表明,EDGE 能有效捕捉性能极值,并给出更准确的分布边界估计,为模型选择和稳健性检验提供了可操作的见解。我们的代码可在 https://github.com/AIGNLAI/EDGE 获取。
引用
@article{arxiv.2509.22580,
title = {The Lie of the Average: How Class Incremental Learning Evaluation Deceives You?},
author = {Guannan Lai and Da-Wei Zhou and Xin Yang and Han-Jia Ye},
journal= {arXiv preprint arXiv:2509.22580},
year = {2026}
}