通过预训练执行语法转换以强化结构归纳偏置
计算与语言
2024-07-08 v1
摘要
模型需要适当的归纳偏置才能有效地从少量数据中学习,并在训练分布之外进行系统性泛化。虽然 Transformer 在高度灵活和强大,但对于 seq2seq 任务,尤其是涉及语法转换的任务(如将主动语态转换为被动语态或语义解析),仍可从增强的结构归纳偏置中受益。本文提出通过对依存树进行合成语法转换进行中间预训练,以增强 Transformer 的结构归纳偏置。我们的实验确认,这有助于少量学习语法任务(如块化),并改进语义解析的结构泛化。我们的分析表明,中间预训练导致注意力头跟踪哪些语法转换被应用于哪些标记,并且该模型可以在下游任务中利用这些注意力头。
引用
@article{arxiv.2407.04543,
title = {Strengthening Structural Inductive Biases by Pre-training to Perform Syntactic Transformations},
author = {Matthias Lindemann and Alexander Koller and Ivan Titov},
journal= {arXiv preprint arXiv:2407.04543},
year = {2024}
}