反向传播之外的缩放规律
机器学习
2022-10-27 v1 人工智能
计算与语言
神经与进化计算
机器学习
摘要
为了更好地理解生物大脑可能如何学习,人们长期以来一直在研究反向传播的替代方法。近期,它们作为更高效地训练神经网络的方法也引起了关注。通过放宽反向传播固有的约束(例如,对称的前馈和反馈权重、顺序更新),这些方法带来了令人鼓舞的前景,例如局部学习。然而,不同方法在最终任务性能、收敛速度以及最终的计算和数据需求方面的权衡却很少被概述。在这项工作中,我们使用缩放规律来研究直接反馈对齐 (DFA) 高效训练因果 decoder-only Transformer 的能力。缩放规律提供了建模决策所隐含权衡的概述,甚至可以推断其如何迁移到越来越大的模型中。我们发现 DFA 无法提供比反向传播更高效的缩放:不存在任何一种情况,使得使用 DFA 造成的损失退化值得其带来的计算预算的潜在减少。我们的发现与替代训练方法社区先前的信念不一致,并凸显了采用整体性经验方法以更好理解建模决策的必要性。
关键词
引用
@article{arxiv.2210.14593,
title = {Scaling Laws Beyond Backpropagation},
author = {Matthew J. Filipovich and Alessandro Cappelli and Daniel Hesslow and Julien Launay},
journal= {arXiv preprint arXiv:2210.14593},
year = {2022}
}
备注
I Can't Believe It's Not Better Workshop, NeurIPS 2022