用 KARE 训练 NTK 以实现泛化
机器学习
2025-05-22 v2
摘要
与训练好的深度神经网络(DNN)相关的数据依赖神经正切核(NTK;Jacot 等人,2018)的性能通常与完整网络的性能相当或更优。这意味着通过梯度下降进行的 DNN 训练通过优化 NTK 隐式地执行核学习。在本文中,我们提出显式地优化 NTK。我们不是最小化经验风险,而是使用最近开发的核对齐风险估计器(KARE;Jacot 等人,2020)训练 NTK 以最小化其泛化误差。我们的模拟和真实数据实验表明,用 KARE 训练的 NTK 始终与原始 DNN 和 DNN 诱导的 NTK(后核)性能相当或显著优于它们。这些结果表明,在某些设置下,显式训练的核可以优于传统的端到端 DNN 优化,挑战了 DNN 的传统主导地位。我们认为 NTK 的显式训练是一种过参数化特征学习的形式。
引用
@article{arxiv.2505.11347,
title = {Training NTK to Generalize with KARE},
author = {Johannes Schwab and Bryan Kelly and Semyon Malamud and Teng Andrea Xu},
journal= {arXiv preprint arXiv:2505.11347},
year = {2025}
}