为白板着色:预训练赋予序列到序列模型一种层次化归纳偏置
计算与语言
2022-03-18 v1
摘要
词与词之间的关系由层次结构而非线性顺序支配。序列到序列(seq2seq)模型尽管在下游自然语言处理(NLP)应用中取得成功,但在执行句法变换(例如将陈述句转换为疑问句)时,往往无法以对层次敏感的方式泛化。然而,对 seq2seq 模型的句法评估仅考察了在执行句法变换前未经过自然语言数据预训练的模型,尽管已有发现表明预训练能在语言模型中诱导出层次化语言泛化能力;换言之,seq2seq 模型的句法能力可能被严重低估了。我们利用预训练的 seq2seq 模型 T5 和 BART,以及它们的多语言变体 mT5 和 mBART 来弥补这一空白。我们评估了它们能否在两种语言的两种变换上实现层次化泛化:英语和德语中的疑问句生成与被动化。我们发现,预训练的 seq2seq 模型在执行句法变换时能够层次化地泛化,而从零开始在句法变换上训练的模型则不能。这一结果为从非标注自然语言文本中学习层次化句法信息提供了证据,同时也表明 seq2seq 模型具备句法泛化能力,尽管其所需接触的语言数据远多于人类学习者。
引用
@article{arxiv.2203.09397,
title = {Coloring the Blank Slate: Pre-training Imparts a Hierarchical Inductive Bias to Sequence-to-sequence Models},
author = {Aaron Mueller and Robert Frank and Tal Linzen and Luheng Wang and Sebastian Schuster},
journal= {arXiv preprint arXiv:2203.09397},
year = {2022}
}
备注
Accepted to Findings of ACL 2022