SpikeBERT:从BERT经知识蒸馏学习的语言Spikformer
计算与语言
2024-02-22 v4
摘要
脉冲神经网络(SNNs)为实现深度神经网络提供了一种更有能效的途径。然而,现有用于语言任务的SNN网络架构仍然简单且相对浅层,深度架构尚未被充分探索,导致与主流基于transformer的网络(如BERT)相比存在显著性能差距。为此,我们改进了近期提出的脉冲Transformer(即Spikformer),使其能够处理语言任务,并提出一种两阶段知识蒸馏方法来训练它,该方法结合从BERT蒸馏知识在大量无标注文本上预训练,以及通过再次从在相同训练样本上微调的BERT进行知识蒸馏,用任务特定实例微调。通过大量实验,我们表明用我们的方法训练的模型(命名为SpikeBERT)优于最先进的SNN,甚至在英文和中文文本分类任务上取得与BERT相当的结果,且能耗大幅降低。我们的代码可在https://github.com/Lvchangze/SpikeBERT获取。
引用
@article{arxiv.2308.15122,
title = {SpikeBERT: A Language Spikformer Learned from BERT with Knowledge Distillation},
author = {Changze Lv and Tianlong Li and Jianhan Xu and Chenxi Gu and Zixuan Ling and Cenyuan Zhang and Xiaoqing Zheng and Xuanjing Huang},
journal= {arXiv preprint arXiv:2308.15122},
year = {2024}
}