形式语言上的预预训练:引导语言偏置
计算与语言
2025-05-28 v2 人工智能
机器学习
摘要
在形式语言上进行预训练可提高语言模型获取自然语言的效果。哪些形式语言特征能够导致有效的迁移?在语言学和复杂性理论的见解指导下,我们假设只有当两种条件满足时,才会发生有效的迁移:形式语言应捕捉自然语言中存在的依赖结构,并且其计算限制应在模型架构的计算限制范围内。我们对transformer模型在形式语言上的预预训练(在自然语言上进行预训练之前进行训练)进行实验,发现捕获层次依赖关系的形式语言确实使语言模型在自然语言上实现更低的损失并表现出更好的语言泛化能力,而其他形式语言则不行。我们还发现,对形式语言应在模型架构的计算限制范围内的假设也获得了适度的支持。令人惊讶的是,预预训练的训练效率高于在相同规模的自然语言上训练。对于一个约16亿参数的语言模型,在约16亿个自然语言标记上的训练,预预训练仅需33%的标记预算即可实现相同的损失并获得更好的语言泛化。最后,我们还给出了从形式语言到自然语言迁移的机制证据:在预预训练期间获得的注意力头对于模型在语法评估任务上的性能至关重要。
引用
@article{arxiv.2502.19249,
title = {Between Circuits and Chomsky: Pre-pretraining on Formal Languages Imparts Linguistic Biases},
author = {Michael Y. Hu and Jackson Petty and Chuan Shi and William Merrill and Tal Linzen},
journal= {arXiv preprint arXiv:2502.19249},
year = {2025}
}
备注
ACL 2025 Camera Ready