重访非独立同分布情境下的泛化度量:基于分布迁移的实证研究
机器学习
2026-02-03 v1
摘要
泛化仍是深度学习中一个核心且尚未解决的挑战,尤其是如何在测试时评估前预测模型性能。本文基于江等人(2020)的大规模研究,以及�ziugaite等人(2020)关于不同训练配置下不稳定性的关注,构建了在非IID情境下评估泛化度量鲁棒性的基准。我们在10,000个超参数配置下训练小到中等规模的模型,并评估了超过40个可从训练好的模型和可用训练数据中计算得到的度量。我们在多个维度上显著扩大了实验范围:(i) 将评估扩展到标准IID设置之外,纳入针对各种分布迁移的鲁棒性基准测试;(ii) 评估多个架构和训练配方;(iii) 新增融合校准和信息准则基于度量,以评估其与IID及OOC泛化的对齐程度。我们发现,分布迁移会显著改变许多泛化度量的预测性能,而较小的子集在不同设置下保持相对稳定。
引用
@article{arxiv.2602.01718,
title = {Revisiting Generalization Measures Beyond IID: An Empirical Study under Distributional Shift},
author = {Sora Nakai and Youssef Fadhloun and Kacem Mathlouthi and Kotaro Yoshida and Ganesh Talluri and Ioannis Mitliagkas and Hiroki Naganuma},
journal= {arXiv preprint arXiv:2602.01718},
year = {2026}
}