中文

代数网络

机器学习 2020-06-17 v2 机器学习

摘要

神经网络历来是从 f:RnRm{f: \mathbb{R}^n \to \mathbb{R}^m } 中的函数集逐层构建的,即激活值和权重/参数由实数 R\mathbb{R} 表示。我们的工作考虑了更丰富的激活值和权重对象集,并通过研究它们在两个挑战性问题上的性能,对作为数值表示的替代代数进行了全面研究:使用 ImageNet 数据集的大规模图像分类,以及使用 enwiki8 和 WikiText-103 数据集的语言建模。我们将这类更广泛的模型称为代数网络(AlgebraNets)。我们的发现表明,先前工作(在较小数据集上探索了由 C\mathbb{C}(复数)和 H\mathbb{H}(四元数)构建的神经网络)的结论并不总能迁移到这些具有挑战性的环境中。然而,我们的结果表明,存在一些替代代数,与 R\mathbb{R} 相比,它们能提供更好的参数效率和计算效率。我们考虑了 C\mathbb{C}H\mathbb{H}M2(R)M_{2}(\mathbb{R})2×22\times2 实值矩阵的集合)、M2(C)M_{2}(\mathbb{C})M3(R)M_{3}(\mathbb{R})M4(R)M_{4}(\mathbb{R})。此外,我们注意到这些代数中的乘法比实数乘法具有更高的计算密度,这在参数重用本身受限的情况下(如自回归推理和稀疏神经网络)是一个有用的特性。因此,我们研究了如何在代数网络中引入稀疏性。我们希望我们在大规模、实用基准上的有力结果将激发对这些非常规架构的进一步探索,这些架构挑战了神经网络权重和激活值默认使用实数的选择。

关键词

引用

@article{arxiv.2006.07360,
  title  = {AlgebraNets},
  author = {Jordan Hoffmann and Simon Schmitt and Simon Osindero and Karen Simonyan and Erich Elsen},
  journal= {arXiv preprint arXiv:2006.07360},
  year   = {2020}
}