BERT 之后:其他 Muppets 模型如何理解语言?
计算与语言
2022-10-03 v2
摘要
现有的预训练 transformer 分析工作通常一次仅关注一两个模型族,忽视了架构与预训练目标的差异性。在我们的工作中,我们利用 oLMpics 基准与心理语言学探测数据集,针对包含 T5、BART 与 ALBERT 的 29 个多样化模型展开研究。此外,我们将 oLMpics 的零样本设置适配于自回归模型,并评估了不同规模的 GPT 网络。我们的发现表明,这些模型均无法以零样本方式解决组合性问题,意味着该能力无法通过现有预训练目标习得。进一步,我们发现架构、方向性、数据集规模与预训练目标等全局模型决策并不能预测模型的语言能力。
引用
@article{arxiv.2205.10696,
title = {Life after BERT: What do Other Muppets Understand about Language?},
author = {Vladislav Lialin and Kevin Zhao and Namrata Shivagunde and Anna Rumshisky},
journal= {arXiv preprint arXiv:2205.10696},
year = {2022}
}