SIP:通过模拟将结构归纳偏置注入序列到序列模型
计算与语言
2024-07-11 v3
摘要
强归纳偏置能够从少量数据学习,并有助于训练分布外的泛化。Transformer 等流行神经架构本身缺乏针对序列到序列 NLP 任务的强结构归纳偏置。因此,即便在大量文本上预训练,它们仍难以在训练分布外实现系统性泛化,例如外推至更长输入。我们展示了如何通过预训练序列到序列模型在合成数据上模拟结构变换,从而高效注入结构归纳偏置。具体而言,我们通过预训练 Transformer 根据给定的有限状态转换器(FST)描述来模拟 FST,将朝向 FST 的归纳偏置注入其中。实验表明,该方法赋予了所需的归纳偏置,从而改善了类 FST 任务的系统性泛化与少样本学习。分析显示,微调后的模型准确捕捉了未见底层 FST 的状态动态,表明模拟过程已被微调模型内化。
引用
@article{arxiv.2310.00796,
title = {SIP: Injecting a Structural Inductive Bias into a Seq2Seq Model by Simulation},
author = {Matthias Lindemann and Alexander Koller and Ivan Titov},
journal= {arXiv preprint arXiv:2310.00796},
year = {2024}
}
备注
ACL 2024 camera-ready