中文

Guess-and-Learn (G&L):冷启动适应累积误差成本度量

机器学习 2025-09-01 v1

摘要

机器学习模型的评估通常侧重最终准确率,忽略了适应成本:即模型从零开始学习时所遭受的累积错误。Guess-and-Learn (G&L) v1.0旨在衡量冷启动适应性——模型在对 unlabeled 数据集进行顺序标注时所犯下的总错误数。在每一步中,学习者选择一个实例,预测其标签,获得真实标签,然后在online(逐样本)或batch(延迟)模式下更新参数。由此产生的误差轨迹揭示了适应速度、选择质量和偏差等动态,这些在端点指标中难以察觉。G&L定义了四条轨迹(Scratch/Pretrained × Online/Batch)以消除初始化和更新频率的影响。我们形式化了该协议,关联到经典的错误界理论,并估计了一个启发式的“oracle reference band”作为MNIST的可信度参考。在MNIST和AG News上的基准实验,涵盖了经典方法(Perceptron、k-NN)、卷积网络(CNN、ResNet-50)以及预训练变换器(ViT-B/16、BERT-base),揭示了早期阶段效率的系统性差异:较小的模型可通过更少的初始错误进行适应,而预训练效益因领域而异。在所有设置下,当前模型均显著高于oracle band,凸显了适应性差距。通过量化早期学习的错误成本,G&L补充了传统基准,提供了一个可复现的框架,用于开发不仅在极限情况下的模型准确,而且从第一示例就可靠的学习者。

关键词

引用

@article{arxiv.2508.21270,
  title  = {Guess-and-Learn (G&L): Measuring the Cumulative Error Cost of Cold-Start Adaptation},
  author = {Roland Arnold},
  journal= {arXiv preprint arXiv:2508.21270},
  year   = {2025}
}

备注

15 pages, 7 figures. Main text is 10 pages. Code and data are available at https://github.com/RolandWArnold/guess-and-learn-benchmark