论自然语言模型的压缩
计算与语言
2021-12-23 v1 机器学习
摘要
深度神经网络是有效的特征提取器,但其规模过大以致难以部署。由于参数数量巨大,不同层中参数的可解释性并不直观。这正是神经网络有时被视为黑箱的原因。尽管更简单的模型更易解释,但找到它们并不容易。若找到,一个能从零开始拟合数据的稀疏网络将有助于解释神经网络的参数。为此,彩票假设指出典型稠密神经网络包含一个小的稀疏子网络,可在相同步数内训练达到相近的测试准确率。本工作的目标是评估自然语言模型(NLM)是否存在此类可训练子网络。为实现该目标,我们将综述量化、知识蒸馏和剪枝等最先进的压缩技术。
引用
@article{arxiv.2112.11480,
title = {On the Compression of Natural Language Models},
author = {Saeed Damadi},
journal= {arXiv preprint arXiv:2112.11480},
year = {2021}
}