BiPFT: 具有二值化残差多项式低秩估计的二值预训练基础 Transformer
机器学习
2024-06-21 v2
摘要
预训练基础模型为广泛的下游任务提供了实质性的好处,这可能是通向通用人工智能的最具潜力的技术之一。然而,为了最大化任务无关知识而扩大基础 Transformer 的规模带来了计算挑战,尤其是在手机等资源受限的设备上。这项工作提出了首个用于自然语言理解 (NLU) 任务的二值预训练基础 Transformer (BiPFT),它显著节省了 56 倍的运算和 28 倍的内存。与以往特定于任务的二值 Transformer 相比,BiPFT 在二值神经网络 (BNNs) 的学习能力上表现出显著提升,将 BNNs 推入了预训练时代。得益于广泛的预训练数据,我们进一步提出了一种数据驱动的二值化方法。具体而言,我们首先分析了自注意力操作中的二值化误差,并推导了二值化误差的多项式。为了模拟全精度自注意力,我们将二值化误差定义为二值化残差多项式,然后引入低秩估计器来对这些多项式进行建模。大量实验验证了 BiPFT 的有效性,在 GLUE 基准上平均性能超越了特定任务的基线 15.4\%。BiPFT 还展示了对超参数变化的改进的鲁棒性、提高的优化效率以及对下游蒸馏依赖的减少,从而在各种 NLU 任务上具有更好的泛化能力,并简化了 BNNs 的下游流水线。我们的代码和预训练模型已在 https://github.com/Xingrun-Xing/BiPFT 上公开提供。
引用
@article{arxiv.2312.08937,
title = {BiPFT: Binary Pre-trained Foundation Transformer with Low-rank Estimation of Binarization Residual Polynomials},
author = {Xingrun Xing and Li Du and Xinyuan Wang and Xianlin Zeng and Yequan Wang and Zheng Zhang and Jiajun Zhang},
journal= {arXiv preprint arXiv:2312.08937},
year = {2024}
}