中文

技能学习的物理学

机器学习 2025-01-22 v1 人工智能 数据分析、统计与概率 机器学习

摘要

我们旨在理解技能学习的物理学,即在训练过程中神经网络是如何学习技能的。我们首先观察到了多米诺效应,即技能是按顺序学习的,且值得注意的是,某些技能恰好在其他技能完成学习后才开始学习,类似于多米诺骨牌的依次倒下。为了理解多米诺效应及技能学习的相关行为,我们采用了物理学家的抽象与简化方法。我们提出了三个复杂度不同的模型——几何模型、资源模型和多米诺模型,在真实性与简单性之间进行权衡。多米诺效应可以在几何模型中重现,其资源解释启发了资源模型,而资源模型又可以进一步简化为多米诺模型。这些模型呈现了不同层次的抽象与简化;每个模型都可用于研究技能学习的某些方面。几何模型为神经缩放定律和优化器提供了有趣的见解;资源模型揭示了组合任务的学习动态;多米诺模型则展示了模块化的优势。这些模型不仅在概念上引人入胜——例如,我们展示了 Chinchilla 缩放定律如何从几何模型中涌现,而且在实践中也通过启发算法开发而具有实用价值——例如,我们展示了受这些玩具模型启发的一些简单算法改变如何加速深度学习模型的训练。

关键词

引用

@article{arxiv.2501.12391,
  title  = {Physics of Skill Learning},
  author = {Ziming Liu and Yizhou Liu and Eric J. Michaud and Jeff Gore and Max Tegmark},
  journal= {arXiv preprint arXiv:2501.12391},
  year   = {2025}
}

备注

25 pages, 20 figures. Codes are available at https://github.com/KindXiaoming/physics_of_skill_learning