通过留一误差的视角看泛化
机器学习
2022-03-08 v1
摘要
尽管深度学习模型在解决各类学习任务上取得了巨大的经验成功,我们对其泛化能力的理论理解仍非常有限。基于 VC 维或 Rademacher 复杂度等工具的经典泛化界迄今不适用于深度模型,且令人怀疑这些技术即便在最理想设定下(Nagarajan & Kolter, 2019)也无法给出紧界。在本工作中,我们转而重新审视留一(LOO)误差这一概念,用以度量所谓核 regime 下深度模型的泛化能力。尽管 LOO 误差在统计学中很流行,在深度学习语境下却被大幅忽视。通过依托近期建立的神经网络与核学习之间的联系,我们利用留一误差的闭式表达,从而得到一个高效的测试误差代理。我们从理论和经验上均表明,留一误差能够捕捉泛化理论中的多种现象,如双下降、随机标签或迁移学习。因此,我们的工作表明留一误差为估计核 regime 下深度神经网络的泛化能力提供了可行途径,为该泛化领域潜在的新研究方向打开了大门。
引用
@article{arxiv.2203.03443,
title = {Generalization Through The Lens Of Leave-One-Out Error},
author = {Gregor Bachmann and Thomas Hofmann and Aurélien Lucchi},
journal= {arXiv preprint arXiv:2203.03443},
year = {2022}
}