结构泛化对序列到序列模型而言是困难的
计算与语言
2022-10-25 v1
摘要
序列到序列(seq2seq)模型已在众多 NLP 任务中取得成功,包括那些需要预测语言结构的任务。然而,近期关于组合泛化的工作表明,seq2seq 模型在泛化到训练未见过语言结构时准确率极低。我们给出新的证据,表明这是 seq2seq 模型的一个普遍局限,不仅存在于语义解析中,也存在于句法解析与文本到文本任务中,且这一局限常可由内建语言知识的神经符号模型克服。我们进一步报告了一些实验,对造成这些局限的原因给出初步解答。
引用
@article{arxiv.2210.13050,
title = {Structural generalization is hard for sequence-to-sequence models},
author = {Yuekun Yao and Alexander Koller},
journal= {arXiv preprint arXiv:2210.13050},
year = {2022}
}
备注
Accepted in EMNLP 2022