Greenformers:通过低秩近似提高Transformer模型的计算与内存效率
机器学习
2021-08-25 v1 人工智能
计算复杂性
摘要
在本论文中,我们介绍了Greenformers,这是一套通过低秩近似方法提高近期著名Transformer模型效率的模型效率方法集。深度学习模型的发展趋势倾向于产生更复杂、更庞大的模型。虽然这能带来更好、更准确的预测,但产生的模型成本也更高,因为它需要数周的训练时间和大量的GPU资源。特别是,基于Transformer的模型自2017年首次亮相以来,其规模和计算成本急剧增加,从约1亿参数增长到2021年初的约1.6万亿参数。这种计算量巨大的模型也对环境造成了巨大成本,甚至达到了令人担忧的碳足迹水平。其中一些模型如此庞大,以至于没有GPU集群甚至无法运行。Greenformers通过应用低秩近似方法来提高Transformer模型的效率。具体来说,我们提出了一种称为Low-Rank Transformer的低秩分解方法来提高Transformer模型的效率。我们进一步将该模型与现有的低秩分解方法Linformer进行了比较。基于我们的分析,Low-Rank Transformer模型适合在处理短序列(<= 512)输入数据时提高时间和内存效率,而Linformer模型适合在处理长序列输入数据(>= 512)时提高效率。我们还表明,Low-Rank Transformer更适合设备端部署,因为它显著减小了模型尺寸。此外,我们估计将LRT应用于现有的BERT-base模型可以显著降低开发此类模型的计算、经济和环境成本,降幅超过其原始成本的30%。
引用
@article{arxiv.2108.10808,
title = {Greenformers: Improving Computation and Memory Efficiency in Transformer Models via Low-Rank Approximation},
author = {Samuel Cahyawijaya},
journal= {arXiv preprint arXiv:2108.10808},
year = {2021}
}