三合一:训练更深 Forward-Forward 网络的三种简单技术
机器学习
2023-12-13 v2 计算机视觉与模式识别
摘要
现代机器学习模型能在多种非平凡任务上超越人类。然而,随着模型复杂度提升,它们消耗大量算力,且仍难以有效泛化至未见过的数据。局部学习聚焦于每次更新模型参数的子集,已成为解决这些问题的一种有前景的技术。近来,一种名为 Forward-Forward 的新颖局部学习算法因其创新的学习方式受到广泛关注。遗憾的是,由于可扩展性问题,其应用仅限于较小数据集。为此,我们提出 The Trifecta,一组协同极佳并大幅改进深层网络下 Forward-Forward 算法的三种简单技术。我们的实验表明,在简单数据集上,我们的模型在训练速度与测试精度方面与结构类似的基于反向传播的模型相当。这得益于逐层在局部学习到具信息性的表征,并在传播至架构更深层时保持其信息性。这在 CIFAR-10 上取得了约 84% 的准确率,较原始 FF 算法显著提升(25%)。这些结果凸显了 Forward-Forward 作为反向传播真正竞争者及一个有前景的研究方向的潜力。
引用
@article{arxiv.2311.18130,
title = {The Trifecta: Three simple techniques for training deeper Forward-Forward networks},
author = {Thomas Dooms and Ing Jyh Tsang and Jose Oramas},
journal= {arXiv preprint arXiv:2311.18130},
year = {2023}
}