中文

算术外推性能的度量

机器学习 2019-11-11 v2 神经与进化计算

摘要

神经算术逻辑单元(NALU)是一种可学习隐藏状态元素间精确算术运算的神经网络层。NALU 的目标是学习完美的外推,这要求学习未知算术问题底层的精确逻辑。评估 NALU 的性能并非易事,因为一个算术问题可能有多解。因此,单实例 MSE 已被用于评估和比较模型间的性能。然而,很难解释何种量级的 MSE 代表正确解以及模型对初始化的敏感性。我们提出使用成功准则来衡量模型是否以及何时收敛。利用成功准则,我们可以总结多种初始化种子下的成功率并计算置信区间。我们贡献了先前算术基准的通用版本,以度量模型在不同条件下的敏感性。据我们所知,这是首个针对 NALU 及其子单元收敛性的广泛评估。利用成功准则总结 4800 次实验,我们发现持续学习算术外推具有挑战性,尤其是乘法。

关键词

引用

@article{arxiv.1910.01888,
  title  = {Measuring Arithmetic Extrapolation Performance},
  author = {Andreas Madsen and Alexander Rosenberg Johansen},
  journal= {arXiv preprint arXiv:1910.01888},
  year   = {2019}
}

备注

Published at Science meets Engineering of Deep Learning at 33rd Conference on Neural Information Processing Systems (NeurIPS 2019), Vancouver, Canada