神经网络推理学习:泛化、未见过的数据与布尔度量
机器学习
2022-10-21 v2 机器学习
摘要
本文考虑了 [ZRKB21] 中引入的指针取值检索(PVR)基准,其中“推理”函数作用于数字串以产生标签。更一般地,本文考虑在神经网络上用梯度下降(GD)学习逻辑函数。首先证明,为在对称神经网络上用梯度下降学习逻辑函数,泛化误差可依据目标函数的噪声稳定性给出下界,支持了 [ZRKB21] 中的猜想。随后证明,在分布偏移设定下,当数据保留对应于冻结单一特征(称为规范保留)时,对于若干相关架构,梯度下降的泛化误差可用布尔影响给出紧刻画。这在线性模型上得到证明,并在 MLP 与 Transformer 等其他模型上经实验支持。特别地,这提出了如下假设:对此类架构及学习如 PVR 函数等逻辑函数,GD 倾向于对低阶表示具有隐式偏置,进而在二次损失下给出泛化误差的布尔影响。
引用
@article{arxiv.2205.13647,
title = {Learning to Reason with Neural Networks: Generalization, Unseen Data and Boolean Measures},
author = {Emmanuel Abbe and Samy Bengio and Elisabetta Cornacchia and Jon Kleinberg and Aryo Lotfi and Maithra Raghu and Chiyuan Zhang},
journal= {arXiv preprint arXiv:2205.13647},
year = {2022}
}
备注
To appear in NeurIPS 2022