中文

关于为 Transformer 模型预训练嵌入初始化的探讨

计算与语言 2024-07-18 v1

摘要

目前,使用随机初始化方案而非预训练嵌入来训练Transformer基模型已成为常见做法。我们发现,来自GloVe的预训练词嵌入以及从T5和mT5等语言模型中提取的子词嵌入,与随机初始化相比表现要差得多。这一结果虽违反直觉,因为预训练的表示优势和迁移学习优势众所周知。有趣的是,我们也发现BERT和mBERT的嵌入优于随机初始化,显示出预训练表示的优势。在本文中,我们认为这些混合结果的原因可能来自于模型对参数分布的敏感性以及嵌入与位置编码之间的相互作用。我们观察到,预训练的GloVe、T5和mT5嵌入的值分布更宽泛。如前所述,这种大值初始化可能导致训练不佳,因为会导致输出饱和。进一步地,较大的嵌入值实际上可以吸收位置编码的较小值,从而丢失位置信息。对预训练嵌入进行标准化以缩小范围(例如遵循Xavier标准)可为GloVe、T5和mT5嵌入带来显著提升。另一方面,尽管BERT预训练嵌入较大,但仍相对接近Xavier初始化范围,这可能使其有效地传递预训练知识。

关键词

引用

@article{arxiv.2407.12514,
  title  = {On Initializing Transformers with Pre-trained Embeddings},
  author = {Ha Young Kim and Niranjan Balasubramanian and Byungkon Kang},
  journal= {arXiv preprint arXiv:2407.12514},
  year   = {2024}
}