深度平衡模型
机器学习
2019-10-30 v2 机器学习
摘要
我们提出一种建模序列数据的新方法:深度平衡模型(DEQ)。基于许多现有深度序列模型的隐藏层会收敛到某固定点的观察,我们提出 DEQ 方法,通过求根直接找到这些平衡点。该方法等价于运行一个无限深度(权重绑定)前馈网络,但具有显著优势:可利用隐式微分对平衡点进行解析反向传播。使用此方法,这些网络的训练与预测仅需常数内存,而与网络的有效“深度”无关。我们展示了 DEQ 如何应用于两个最先进的深度序列模型:自注意力 Transformer 与网格网络(trellis networks)。在大规模语言建模任务(如 WikiText-103 基准)上,我们表明 DEQ 1)常在这些最先进模型上提升性能(参数量相近);2)具有与现有模型相似的计算需求;3)大幅降低内存消耗(常为训练大型序列模型的瓶颈),实验中演示了高达 88% 的内存削减。代码见 https://github.com/locuslab/deq 。
引用
@article{arxiv.1909.01377,
title = {Deep Equilibrium Models},
author = {Shaojie Bai and J. Zico Kolter and Vladlen Koltun},
journal= {arXiv preprint arXiv:1909.01377},
year = {2019}
}
备注
NeurIPS 2019 Spotlight Oral