关于非布尔函数未见泛化中最小度偏差的研究
机器学习
2024-06-11 v1
摘要
我们研究了随机特征 (RF) 模型和 Transformer 的域外泛化。我们首先证明,在“未见泛化 (GOTU)”设置下(即训练数据在域的某一部分完全可见,但测试在另一部分进行),对于小特征机制下的 RF 模型,收敛至最小度插值器,这与布尔情况一致 (Abbe et al., 2023)。然后我们考虑稀疏目标机制,并解释该机制如何与小特征机制相关,但在非布尔情况下具有可能改变这一图景的不同正则化项。我们展示了具有 q 元数据 token 的稀疏机制下的两种不同结果:(1) 如果数据使用单位根嵌入,那么对于 RF 模型,会像布尔情况一样学习到最小度插值器;(2) 如果数据没有如此嵌入(例如,简单地作为整数嵌入),那么 RF 模型和 Transformer 可能不会学习到最小度插值器。这表明布尔设置及其单位根推广是特殊情况,其中最小度插值器为学习的发生方式提供了罕见的刻画。对于更一般的整数和实值设置,更细致的图景仍有待完全刻画。
引用
@article{arxiv.2406.06354,
title = {On the Minimal Degree Bias in Generalization on the Unseen for non-Boolean Functions},
author = {Denys Pushkin and Raphaël Berthier and Emmanuel Abbe},
journal= {arXiv preprint arXiv:2406.06354},
year = {2024}
}
备注
9 pages of main body, 24 pages in total. 7 figures Proceedings of the 41-st International Conference on Machine Learning, Vienna, Austria. PMLR 235, 2024