Seq2Seq-Attention 模型中语言泛化与失效之间的细微界线
计算与语言
2018-05-10 v2
摘要
基于 Seq2Seq 的神经网络架构已成为处理序列到序列语言任务的首选架构。尽管在这些任务上表现优异,近期工作指出这些模型通常未能充分捕捉在训练数据分布密集区之外泛化所需的语言结构 \cite{ettinger2017towards},因而可能在分布尾端样本(如含噪声的输入 \citep{belkinovnmtbreak} 或不同长度的输入 \citep{bentivoglinmtlength})上失效。本文中,我们考察模型在具有明确定构的简单符号重写任务上的泛化能力。我们发现,模型在此训练分布之外泛化该结构的能力极大依赖于所选取的随机种子,即便在标准测试集上的性能保持不变。这表明模型捕捉可泛化结构的能力高度敏感。此外,这种敏感性在标准测试集评估时可能并不显现。
引用
@article{arxiv.1805.01445,
title = {The Fine Line between Linguistic Generalization and Failure in Seq2Seq-Attention Models},
author = {Noah Weber and Leena Shekhar and Niranjan Balasubramanian},
journal= {arXiv preprint arXiv:1805.01445},
year = {2018}
}
备注
Workshop on New Forms of Generalization in Deep Learning and NLP (NAACL 2018), revised to update some references