预训练语言模型胚胎学:ALBERT 的诞生
计算与语言
2020-10-30 v2
摘要
尽管预训练语言模型(LM)的行为已被充分研究,但预训练期间发生的过程却鲜有探讨。因此我们研究从一组随机初始化参数到全能语言模型的发展过程,称之为预训练语言模型的胚胎学。我们的结果表明,ALBERT 在预训练期间以不同学习速度学会重建与预测不同词性(POS)的 token。我们还发现,语言知识与世界知识并不随预训练推进而普遍提升,下游任务性能亦然。这些发现表明,预训练模型的知识在预训练期间是变化的,更多的预训练步数未必能赋予模型更全面的知识。我们将在 https://github.com/d223302/albert-embryology 提供源代码与预训练模型以复现我们的结果。
引用
@article{arxiv.2010.02480,
title = {Pretrained Language Model Embryology: The Birth of ALBERT},
author = {Cheng-Han Chiang and Sung-Feng Huang and Hung-yi Lee},
journal= {arXiv preprint arXiv:2010.02480},
year = {2020}
}
备注
Accepted to EMNLP 2020, short paper