中文

HashFormers:面向词汇表无关的预训练 Transformer

计算与语言 2022-11-01 v2

摘要

基于 Transformer 的预训练语言模型是词汇表相关的,默认将每个 token 映射到其对应的嵌入。这种一对一映射导致嵌入矩阵占用大量内存(即数百万参数)并随词汇表大小线性增长。先前关于设备端 Transformer 的工作利用形态信息的局部敏感哈希动态即时生成 token 嵌入而无需嵌入矩阵。这些嵌入随后被送入 Transformer 层用于文本分类。然而,这些方法未经预训练。受此工作启发,我们提出 HashFormers,一个新的词汇表无关预训练 Transformer 系列,在给定大幅更小的固定大小嵌入矩阵的情况下支持无限词汇表(即语料库中所有可能的 token)。我们通过首先引入计算廉价的哈希函数将单个 token 分桶到嵌入来实现这一点。我们还提出了三种完全不需要嵌入矩阵的变体,进一步降低内存需求。我们通过经验证明,HashFormers 相比标准预训练 Transformer 更具内存效率,同时在多个文本分类任务上微调时取得可比较的预测性能。例如,我们最高效的 HashFormer 变体仅有可忽略的性能下降(GLUE 上 0.4%),仅使用 99.1K 参数表示嵌入,而最先进模型使用 12.3-38M 参数。

关键词

引用

@article{arxiv.2210.07904,
  title  = {HashFormers: Towards Vocabulary-independent Pre-trained Transformers},
  author = {Huiyin Xue and Nikolaos Aletras},
  journal= {arXiv preprint arXiv:2210.07904},
  year   = {2022}
}

备注

Accepted at EMNLP 2022