拟合大象
机器学习
2021-04-02 v1 人工智能
神经元与认知
摘要
教科书常识主张平滑函数拟合,并暗示对噪声数据的插值会导致较差的泛化。一个相关的启发式原则是拟合参数应少于测量值(奥卡姆剃刀)。令人惊讶的是,当代机器学习(ML)方法(如深度网络 DNNs)尽管对噪声数据进行了插值,却泛化良好。这可通过统计一致插值(SCI)来理解,即对于大数据能最优泛化的数据插值技术。在本文中,我们使用加权插值最近邻(wiNN)算法来阐明 SCI,该算法向 kNN(k-最近邻)添加了奇异权重函数。这表明数据插值可成为大数据下有效的 ML 策略。SCI 澄清了建模自然现象的两种途径之间的关系:理论物理学具有强先验、少参数的理性主义途径,与现代 ML 具有多于数据参数的弱先验经验主义途径。SCI 表明纯经验途径能够成功预测。然而数据插值不提供理论洞见,且训练数据需求可能令人望而却步。复杂的动物大脑介于这些极端之间,具有许多参数但适量训练数据,且先验结构编码于物种特异的中尺度神经电路中。因此,现代 ML 提供了一种不同于物理理论和动物大脑的独特认识论途径。
引用
@article{arxiv.2104.00526,
title = {Fitting Elephants},
author = {Partha P Mitra},
journal= {arXiv preprint arXiv:2104.00526},
year = {2021}
}