中文

Wave Network: 一种超小语言模型

计算与语言 2024-11-12 v4 人工智能

摘要

我们提出了一种新的超小语言模型中的创新性token表示与更新方法:Wave网络。具体而言,我们使用复向量来表示每个token,编码输入文本的全局与局部语义。复向量由两个分量组成:一个表示输入文本全局语义的幅度向量,以及一个捕获各token之间关系及其与全局语义关联的相位向量。在AG News文本分类任务上的实验表明,当从随机初始化的token嵌入生成复向量时,我们的单层Wave网络在波干涉下达到90.91%的准确率,在波调制下达到91.66%——分别优于使用BERT预训练嵌入的单层Transformer 19.23%和19.98%,并接近预训练并微调的BERT base模型的准确率(94.64%)。此外,与BERT base相比,Wave网络在波调制期间将显存占用和训练时间分别减少了77.34%和85.62%。总之,我们使用一个仅含240万参数的小型语言模型,在文本分类任务上实现了与1亿参数BERT模型相当的准确率。

关键词

引用

@article{arxiv.2411.02674,
  title  = {Wave Network: An Ultra-Small Language Model},
  author = {Xin Zhang and Victor S. Sheng},
  journal= {arXiv preprint arXiv:2411.02674},
  year   = {2024}
}