未见数据上的泛化、逻辑推理与度数课程学习
机器学习
2024-11-21 v3 机器学习
摘要
本文研究逻辑(布尔)函数的学习,重点关注未见数据上的泛化(GOTU)设定,这是一种强分布外泛化情形。其动机在于:某些推理任务(如算术/逻辑)中数据具有丰富的组合特性,使得代表性数据采样十分困难,而在 GOTU 下成功学习可初步展现一种“外推”或“推理”型学习器。我们研究了经(S)GD 训练的不同网络架构在 GOTU 下的表现,并从理论与实验两方面证明:对于稀疏函数及一类包含 Transformer、随机特征模型和线性网络实例的网络模型,所学到的是未见数据上的最小度数插值器。更具体地说,这是指对训练数据进行插值且在高阶基元素上 Fourier 质量最小的插值器。这些发现带来两点启示:(1)我们对布尔函数的长度泛化问题(如 Anil 等人 2022)给出了解释;(2)我们提出了一种称为度数课程(Degree-Curriculum)的课程学习算法,通过递增支撑集更高效地学习单项式。最后,我们讨论了向其他模型或非稀疏情形的扩展,其中最小度数偏置可能仍然存在或消退,以及在不希望出现该偏置时如何潜在地予以纠正。
引用
@article{arxiv.2301.13105,
title = {Generalization on the Unseen, Logic Reasoning and Degree Curriculum},
author = {Emmanuel Abbe and Samy Bengio and Aryo Lotfi and Kevin Rizk},
journal= {arXiv preprint arXiv:2301.13105},
year = {2024}
}
备注
extended JMLR version of the original ICML 2023 paper