关于预训练在自然语言推断中的有效利用
计算与语言
2017-10-06 v1
摘要
神经网络在许多 NLP 任务中表现出色,但关于预训练分布式词表示的性能及其与权重初始化和其他超参数的相互作用,仍存在一些未解的问题。我们使用基于注意力的序列到序列模型进行自然语言推断(NLI),以实证方式解答这些问题。具体而言,我们比较了三种类型的嵌入:随机嵌入、预训练嵌入(GloVe、word2vec)和改造嵌入(预训练加上 WordNet 信息)。我们表明,在大型 NLI 语料库中,预训练嵌入优于随机嵌入和改造嵌入。在更受控的数据集上的进一步实验揭示了改造嵌入可能发挥作用的上下文条件。我们还探索了两种初始化模型其余参数的原则性方法:高斯初始化和正交初始化,结果表明后者在 NLI 任务中带来了高达 2.9% 的性能提升。
引用
@article{arxiv.1710.02076,
title = {On the Effective Use of Pretraining for Natural Language Inference},
author = {Ignacio Cases and Minh-Thang Luong and Christopher Potts},
journal= {arXiv preprint arXiv:1710.02076},
year = {2017}
}
备注
This manuscript dates from late Winter 2016