二值与三值自然语言生成
计算与语言
2023-06-06 v1
摘要
三值与二值神经网络实现了无乘法计算,若在专用硬件上实现,有望比全精度网络获得多个数量级的效率提升。然而,由于参数空间和输出空间都高度离散化,此类网络极难优化。对于Transformer文本生成模型而言,由于注意力操作对量化的敏感性以及高基数输出空间中自回归解码的噪声复合效应,困难进一步加剧。我们采用基于统计的权重量化与激活的弹性量化相结合的方法来解决该问题,并展示了在摘要和机器翻译下游任务上的首个三值与二值Transformer模型。我们的三值BART base在CNN/DailyMail基准上取得了41的R1分数,仅比全模型低3.9分,同时效率提升16倍。我们的二值模型虽然准确性较低,但取得了35.6这一相当可观的分数。在机器翻译方面,我们在WMT16 En-Ro基准上取得了21.7和17.6的BLEU分数,而全精度mBART模型分数为26.8。我们还在8位激活设置下对比了我们的方法,其中我们的三值甚至二值权重量化模型可以匹配或超越文献中现有最佳的8位权重量化模型。我们的代码和模型可在 https://github.com/facebookresearch/Ternary_Binary_Transformer 获取。
引用
@article{arxiv.2306.01841,
title = {Binary and Ternary Natural Language Generation},
author = {Zechun Liu and Barlas Oguz and Aasish Pappu and Yangyang Shi and Raghuraman Krishnamoorthi},
journal= {arXiv preprint arXiv:2306.01841},
year = {2023}
}
备注
ACL 2023 Oral