基于可分离性的泛化量化方法:哪一层最优?
机器学习
2024-11-05 v3 人工智能
计算机视觉与模式识别
摘要
深度学习分类和基础模型在面对未见数据时的泛化能力仍然 poorly understood,尤其是在开放集场景下。如何评估网络对新型或扩展输入空间适应能力——这与 few-shot 学习、分布外泛化、域适应和类别发现密切相关。哪些网络层最有可能实现泛化?我们提出一种新方法,用于评估网络表示特定域样本容量,无论该网络是否在该域的所有类别上进行训练。我们的做法是:在针对特定域进行视觉分类微调的最新预训练模型后,我们评估其在该域相关但不同变体数据上的性能。将潜在嵌入表示作为泛化能力的度量,适用于无监督和监督设置。我们在整个网络中发现:(i) 高分类准确率不等于高泛化能力;(ii) 模型的深层不一定泛化最佳,这对剪枝具有启发意义。由于跨数据集观察到的趋势高度一致,我们得出结论:我们的做法揭示了模型不同层泛化本征容量的函数。我们的代码已公开:https://github.com/dyballa/generalization
关键词
引用
@article{arxiv.2405.01524,
title = {A separability-based approach to quantifying generalization: which layer is best?},
author = {Luciano Dyballa and Evan Gerritz and Steven W. Zucker},
journal= {arXiv preprint arXiv:2405.01524},
year = {2024}
}
备注
7 pages, 6 figures