Neural GPU 的扩展与局限
神经与进化计算
2016-11-08 v2 人工智能
摘要
Neural GPU 是一种近期模型,能够以泛化到任意长度输入的方式学习多位数二进制加法和二进制乘法等算法。我们展示了两种简单的方法来提升 Neural GPU 的性能:通过精心设计的课程,以及增大模型规模。后者需要一种内存高效的实现,因为 Neural GPU 的朴素实现内存消耗大。我们发现这些技术扩大了 Neural GPU 可解决的算法问题集合:我们已经能够学习执行所有算术运算(并泛化到任意长的数字),当参数以十进制表示时(令人惊讶的是,此前这是不可能的)。我们还能够训练 Neural GPU 来评估具有多个操作数、需要遵循操作数优先级顺序的长算术表达式,尽管这些仅在二进制表示下成功,且未达到完美精度。此外,我们通过研究其失败模式深入了解了 Neural GPU。我们发现,能够正确泛化到任意长数字的 Neural GPU 仍然在高度对称的、非典型的输入上计算错误:例如,一个在最多 100 位十进制乘法上实现近乎完美泛化的 Neural GPU 可能在 上失败,却在 上成功。这些失败模式让人联想到对抗样本。
引用
@article{arxiv.1611.00736,
title = {Extensions and Limitations of the Neural GPU},
author = {Eric Price and Wojciech Zaremba and Ilya Sutskever},
journal= {arXiv preprint arXiv:1611.00736},
year = {2016}
}