中文

将架构与初始权重区分开来作为神经网络归纳偏置的来源

机器学习 2025-02-28 v1 人工智能

摘要

人工神经网络能够从数据中获取许多人类知识方面,这使其作为人类学习模型具有前景。但这些网络能够学习的内容取决于其归纳偏置——除数据之外影响其发现解决方案的因素——而神经网络的归纳偏置仍知之甚少,这限制了我们从这些系统的性能中得出关于人类学习的结论的能力。认知科学家和机器学习研究者通常将神经网络的架构作为归纳偏置的来源。在本文中,我们探讨了另一种归纳偏置来源——网络的初始权重——通过使用元学习工具来寻找针对特定问题适配的初始权重。我们通过在三个需要不同偏置和形式泛化的任务上进行元训练,评估了四种广泛使用的架构——MLP、CNN、LSTM 和 Transformer——通过进行 430 种不同模型的元训练。我们发现,元学习可以显著减少甚至完全消除不同架构和数据表示之间的性能差异,这表明这些因素可能比通常所假设的那样在归纳偏置方面重要性较小。当差异存在时,通常在没有元学习的情况下表现良好的架构和数据表示倾向于更有效地进行元训练。此外,所有架构在远离其元训练经验的问题上都泛化得不佳,这凸显了需要更强归纳偏置以实现稳健泛化的必要性。

关键词

引用

@article{arxiv.2502.20237,
  title  = {Teasing Apart Architecture and Initial Weights as Sources of Inductive Bias in Neural Networks},
  author = {Gianluca Bencomo and Max Gupta and Ioana Marinescu and R. Thomas McCoy and Thomas L. Griffiths},
  journal= {arXiv preprint arXiv:2502.20237},
  year   = {2025}
}

备注

11 pages, 6 figures, 6 tables