Transformer 语言模型的结构引导
计算与语言
2021-08-03 v1
摘要
基于 Transformer 的语言模型在大量文本数据上预训练后,已证明能极其成功地学习通用的可迁移语言表示。本文研究在不依赖极大量数据预训练的情况下,结构引导是否能让 Transformer 语言模型获得更类人的系统性语言泛化能力。我们探索两种总体思路。“生成式解析”思路将增量解析与词序列作为同一序列建模任务联合建模。“结构脚手架”思路通过额外预测增量成分解析的结构损失来引导语言模型的表示。我们在 BLLIP 数据集的 1400 万词元和 4600 万词元子集上训练所提模型及一个原始 Transformer 语言模型基线,并在 SG Test Suites 和定长 BLiMP 上评估模型的句法泛化性能。两项基准上的实验结果提供了趋同证据:生成式结构监督能在无需数据密集型预训练的情况下,诱导 Transformer 语言模型产生更鲁棒且更类人的语言泛化。
引用
@article{arxiv.2108.00104,
title = {Structural Guidance for Transformer Language Models},
author = {Peng Qian and Tahira Naseem and Roger Levy and Ramón Fernandez Astudillo},
journal= {arXiv preprint arXiv:2108.00104},
year = {2021}
}
备注
To be issued as paper revision for ACL 2021