Charformer:基于梯度子词分词的高效字符级 Transformer
计算与语言
2022-02-24 v3 人工智能
机器学习
摘要
自然语言处理中的最先进模型依赖于独立的刚性子词分词算法,这限制了它们的泛化能力和对新环境的适应性。在本文中,我们提出一种新的模型归纳偏置,将子词分词作为模型的一部分进行端到端学习。为此,我们引入了软的基于梯度的子词分词模块(GBST),它以数据驱动的方式从字符中自动学习潜在的子词表示。具体而言,GBST 枚举候选子词块,并使用块打分网络以位置级方式学习对其打分。我们还引入了 Charformer,一种集成 GBST 并在字节级别上运行的深度 Transformer 模型。通过在英语 GLUE、多语言和含噪文本数据集上的大量实验,我们表明 Charformer 优于一系列有竞争力的字节级基线,同时总体上与基于子词的模型表现相当,有时甚至更优。此外,Charformer 速度很快,在保持有竞争力质量的同时,将原始字节级和子词级 Transformer 的速度提升了 28%–100%。我们认为这项工作为完全端到端训练的高性能无分词模型铺平了道路。
引用
@article{arxiv.2106.12672,
title = {Charformer: Fast Character Transformers via Gradient-based Subword Tokenization},
author = {Yi Tay and Vinh Q. Tran and Sebastian Ruder and Jai Gupta and Hyung Won Chung and Dara Bahri and Zhen Qin and Simon Baumgartner and Cong Yu and Donald Metzler},
journal= {arXiv preprint arXiv:2106.12672},
year = {2022}
}
备注
ICLR 2022 Camera Ready