测试神经网络模型在 NLI 基准间的泛化能力
计算与语言
2019-06-04 v3
摘要
神经网络模型在自然语言推理中非常成功,最佳模型在某些基准中达到 90% 的准确率。然而,这些模型的成功在很大程度上是特定于基准的。我们表明,在一个基准的自然语言推理数据集上训练的模型在其他基准中表现不佳,即使这些基准所假设的推理概念相同或相似。我们在不同数据集上训练了六个高性能神经网络模型,并表明当用取自为同一任务设计的另一语料库的测试集替换原始测试集时,每一个模型都存在泛化问题。鉴于这些结果,我们认为当前大多数神经网络模型在自然语言推理任务中不能很好地泛化。我们发现,当数据集足够相似时,使用大型预训练语言模型有助于迁移学习。我们的结果还强调,当前的 NLI 数据集没有足够广泛地覆盖推理的不同细微差别。
引用
@article{arxiv.1810.09774,
title = {Testing the Generalization Power of Neural Network Models Across NLI Benchmarks},
author = {Aarne Talman and Stergios Chatzikyriakidis},
journal= {arXiv preprint arXiv:1810.09774},
year = {2019}
}
备注
Accepted to the 2019 ACL Workshop BackboxNLP: Analyzing and interpreting neural networks for NLP