我们总是需要简单偏差吗?在野生环境中寻找最优归纳偏置
机器学习
2025-03-14 v1 计算机视觉与模式识别
摘要
神经网络架构倾向于用相对简单的函数来拟合数据。这"简单偏差"广泛被视为其成功的关键因素。本文探讨了这一原理的局限性。基于最近发现简单偏差源于 ReLU 激活函数[96]的研究,我们引入一种方法,通过元学习来学习更适用于特定任务的新型激活函数和归纳偏置。研究发现:在多个任务中,简单偏差是不够的,ReLU 并非最优。在这些情况下,我们学习新的激活函数,通过诱导更高复杂性的先验来获得更好的性能。有趣的是,这些情况对应于神经网络历史上一直难以应对的领域:表格数据、回归任务、shortcut 学习情况以及算法性grokking任务。在比较中,由 ReLU 引起的简单偏差在图像任务中证明足够优越,学习到的最佳激活函数几乎与 ReLU 和 GeLU相同。在实际意义上:与流行信念相反,ReLU 网络的简单偏差并非普遍有用。它在图像分类中近乎最优,但其他归纳偏置有时更可取。我们表明,激活函数可以控制这些归纳偏置,但未来的定制化架构可能提供进一步的好处。仍需进一步研究来表征模型的归纳偏置,超出"复杂性",以及其与数据之间的适配性。
引用
@article{arxiv.2503.10065,
title = {Do We Always Need the Simplicity Bias? Looking for Optimal Inductive Biases in the Wild},
author = {Damien Teney and Liangze Jiang and Florin Gogianu and Ehsan Abbasnejad},
journal= {arXiv preprint arXiv:2503.10065},
year = {2025}
}
备注
IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)