大语言模型在语言之外还学到了什么
计算与语言
2022-10-25 v1
摘要
大语言模型(LMs)已迅速成为自然语言处理的中坚力量。已知这些模型能从大规模文本训练中获取丰富的语言知识。在本文中,我们研究在文本上的预训练是否也为这些模型赋予了有助于非语言推理的“归纳偏置”。在一组包含定量计算、正则表达式识别以及字符串推理的19项多样化非语言任务上,我们发现预训练模型显著优于可比的非预训练神经模型。即使在实验中用参数更少的非预训练模型以解释模型正则化效应,这一结论依然成立。我们进一步通过从不同领域和来源的文本预训练模型来探究文本领域对LMs的影响。我们的实验令人惊讶地揭示,预训练的积极效果即使在多语言文本或计算机代码上预训练、甚至由合成语言生成的文本上预训练时仍然存在。我们的发现暗示了预训练与语言模型的归纳学习能力之间此前未被探索的深层联系。
引用
@article{arxiv.2210.12302,
title = {What do Large Language Models Learn beyond Language?},
author = {Avinash Madasu and Shashank Srivastava},
journal= {arXiv preprint arXiv:2210.12302},
year = {2022}
}
备注
Accepted at the Findings of EMNLP 2022