中文

指数级更快的语言建模

计算与语言 2023-11-22 v2 人工智能 机器学习 神经与进化计算

摘要

语言模型在单次推理时实际上只需使用其神经元的指数级一小部分。作为证明,我们提出 UltraFastBERT,一种 BERT 变体,在推理过程中仅使用 0.3% 的神经元,同时性能与同类 BERT 模型相当。UltraFastBERT 在每一层推理中仅选择性地激活 4095 个神经元中的 12 个。这是通过用快速前馈网络(FFFs)替换前馈网络实现的。虽然目前尚不存在真正高效的实现来释放条件神经执行的全部加速潜力,我们提供了高层 CPU 代码,相比优化后的基线前馈实现实现了 78 倍加速,以及一个 PyTorch 实现,相比等价的批处理前馈推理实现了 40 倍加速。我们发布了训练代码、基准测试设置和模型权重。

关键词

引用

@article{arxiv.2311.10770,
  title  = {Exponentially Faster Language Modelling},
  author = {Peter Belcak and Roger Wattenhofer},
  journal= {arXiv preprint arXiv:2311.10770},
  year   = {2023}
}