训练具有内部状态、无约束连接性和离散激活函数的神经网络
机器学习
2023-12-25 v1 神经与进化计算
摘要
当今最强大的机器学习方法通常旨在训练具有预定义层和可微激活函数的无状态架构。虽然这些方法在自然语言处理和图像识别等领域取得了前所未有的成功,但训练出的模型也容易犯人类不会犯的错误。在本文中,我们认为真正的智能可能需要机器学习模型具备管理内部状态的能力,但我们尚未发现训练此类模型的最有效算法。我们进一步推测,此类算法未必基于深度架构上的梯度下降,而是可能在具有离散激活函数且初始拓扑约束较少(如多个预定义层)的架构上表现最佳。我们展示了设计此类训练算法的持续努力中的一次尝试,将其应用于具有二元激活函数且仅有一个权重矩阵的架构,表明其能够形成自然语言文本的有用表示,但在利用大量训练数据方面存在局限。随后,我们提出了改进该算法以及为类似架构设计其他训练算法的思路。最后,我们讨论了若找到有效训练算法可能获得的潜在益处,并建议了评估这些益处是否在现实中存在的实验。
引用
@article{arxiv.2312.14359,
title = {Training Neural Networks with Internal State, Unconstrained Connectivity, and Discrete Activations},
author = {Alexander Grushin},
journal= {arXiv preprint arXiv:2312.14359},
year = {2023}
}
备注
5 pages, 2 figures